Índice
Incluido en la revista Ocronos. Vol. IX. N.º 9–Septiembre 2026.
Pág. Inicial: Vol. IX; N.º 9: 74
Autor principal (primer firmante): Lissette Estephanie Nieto Espinoza
Fecha recepción: 04/08/2026
Fecha aceptación: 31/08/2026
Ref.: Ocronos. 2026;9(9): 74
https://doi.org/10.58842/AEOC3355
Autores:
Nieto Espinoza Lissette Estephanie
https://orcid.org/0009-0001-6509-1279
Calle Calle Leonardo Anibal.
https://orcid.org/000-0003-3265-3519
Beltran Carreño José Patricio.
https://orcid.org/0000-0002-1972-0812
Categoría profesional:
Medico posgradista de imagenología.
Especialista en imagenología.
Especialista en Medicina familiar, Magister en gerencia de instituciones de salud, Magister en investigación de la salud.
Resumen
- Antecedentes: La inteligencia artificial (IA) se ha propuesto como una herramienta complementaria para mejorar la detección de cáncer de mama y optimizar la carga lectora en programas de cribado mamográfico.
- Objetivo: Evaluar el rendimiento diagnóstico de los sistemas de IA aplicados al cribado de cáncer de mama mediante mamografía digital y tomosíntesis digital mamaria, en comparación con la lectura radiológica humana. Fuentes de información: Se consultaron PubMed/MEDLINE, Embase, Scopus, Web of Science Core Collection, Cochrane Library, IEEE Xplore, ClinicalTrials.gov, WHO ICTRP, medRxiv, arXiv y Google Scholar, con búsqueda hasta el 17 de mayo de 2026. Criterios de elegibilidad: Se incluyeron estudios originales publicados entre 2021 y 2026 que evaluaron IA en programas de cribado mamográfico y reportaron desenlaces diagnósticos u operativos comparables con radiólogos.
- Métodos: La revisión siguió PRISMA 2020 y PRISMA-DTA. La selección y extracción fueron realizadas por revisores independiente. El riesgo de sesgo se valoró con QUADAS-2 y criterios complementarios STARD-AI.
- Resultados: Se incluyeron 12 estudios originales. La IA mostró utilidad como segundo lector, apoyo a lectura única o herramienta de triaje, con reducciones de carga lectora y, en varios estudios, aumento o no inferioridad en la detección de cáncer. La heterogeneidad de algoritmos, diseños, modalidad de imagen, umbrales y estándares de referencia impidió realizar metaanálisis.
- Limitaciones: La evidencia disponible continúa condicionada por variabilidad metodológica, validación externa desigual y escasa información sobre cánceres de intervalo, mortalidad, equidad y costo-efectividad. Registro: PROSPERO CRD420261369508.
- Conclusión: La IA es una herramienta prometedora para el cribado mamográfico cuando se integra bajo supervisión radiológica, calibración local y evaluación continua de seguridad y aplicabilidad clínica.
Palabras clave:
Inteligencia artificial; cáncer de mama; mamografía; cribado poblacional; diagnóstico por imágenes; aprendizaje profundo.
Introducción
El cáncer de mama continúa siendo uno de los principales problemas de salud pública a escala mundial, no solo por su elevada incidencia, sino también por el impacto clínico, emocional, económico y social que genera en las mujeres, sus familias y los sistemas sanitarios. De acuerdo con las estimaciones más recientes de GLOBOCAN 2022, el cáncer de mama se mantiene entre las neoplasias más frecuentes en mujeres y representa una causa importante de mortalidad oncológica global, con una carga particularmente creciente en países de ingresos bajos y medios, donde las brechas en acceso al diagnóstico temprano y al tratamiento oportuno condicionan peores desenlaces clínicos (1). La magnitud del problema exige fortalecer las estrategias de detección precoz, dado que el diagnóstico en estadios iniciales se asocia con mejores tasas de supervivencia, menor necesidad de tratamientos agresivos y mayor posibilidad de preservar la calidad de vida de las pacientes.
La mamografía digital constituye actualmente la herramienta central del cribado poblacional del cáncer de mama. Su implementación ha permitido reducir la mortalidad específica por esta enfermedad en diversos programas organizados, especialmente en mujeres de 50 a 69 años. Sin embargo, su rendimiento diagnóstico no es uniforme y depende de múltiples factores, entre ellos la edad, la densidad mamaria, la calidad técnica del estudio, la experiencia del radiólogo y el modelo de lectura utilizado. En mujeres con mamas densas, el tejido fibroglandular puede enmascarar lesiones malignas, disminuyendo la sensibilidad de la mamografía y aumentando el riesgo de cánceres de intervalo, es decir, tumores diagnosticados entre dos rondas de cribado después de una mamografía inicialmente negativa (2,3). Esta limitación es especialmente relevante porque los cánceres de intervalo suelen presentar características biológicas más agresivas y peor pronóstico en comparación con los tumores detectados en el cribado.
La inteligencia artificial (IA), particularmente los algoritmos de aprendizaje profundo, ha emergido como una de las innovaciones más relevantes en imagenología mamaria. A diferencia de los sistemas tradicionales de detección asistida por computadora, los modelos modernos basados en redes neuronales convolucionales pueden aprender patrones complejos directamente a partir de grandes volúmenes de imágenes etiquetadas. Estos sistemas pueden identificar características sutiles asociadas a malignidad, generar puntuaciones de riesgo, priorizar estudios sospechosos, actuar como segundo lector o apoyar la toma de decisiones del radiólogo. En teoría, la IA podría contribuir a reducir falsos negativos, disminuir la carga de trabajo, mejorar la reproducibilidad diagnóstica y optimizar el flujo de los programas de cribado.
La evidencia publicada en los últimos años ha mostrado resultados prometedores. El ensayo clínico aleatorizado MASAI, realizado en Suecia, evaluó la lectura mamográfica apoyada por IA en un programa de cribado poblacional y reportó una reducción aproximada del 44% en la carga de lectura radiológica, manteniendo una tasa de detección de cáncer comparable o superior a la lectura estándar (4). Este estudio constituye uno de los aportes más relevantes porque traslada la evaluación de la IA desde escenarios retrospectivos controlados hacia condiciones reales de cribado. Asimismo, estudios recientes de implementación en práctica clínica han sugerido que el apoyo de IA puede incrementar la tasa de detección de cáncer sin aumentar de manera proporcional los falsos positivos, aunque estos hallazgos aún requieren interpretación crítica debido a diferencias en diseño, población, algoritmo y estándar de referencia (5).
No obstante, el entusiasmo por la IA debe equilibrarse con una evaluación metodológica rigurosa. La revisión sistemática de Freeman et al., publicada en BMJ en 2021, concluyó que la evidencia disponible en ese momento todavía no permitía establecer con certeza la exactitud de la IA en programas reales de cribado mamográfico, debido a la heterogeneidad de los estudios, el riesgo de sesgo, la escasa validación externa y la limitada aplicabilidad clínica de algunos diseños retrospectivos (6). Este hallazgo es fundamental, ya que muchos estudios de IA reportan altos valores de AUC, sensibilidad o especificidad, pero no siempre utilizan cohortes consecutivas, estándares de referencia adecuados ni separación clara entre conjuntos de entrenamiento, validación y prueba.
Uno de los problemas centrales en la evaluación de IA aplicada a imagen médica es la posibilidad de sobreestimar el rendimiento diagnóstico. Los estudios de casos y controles, las bases de datos enriquecidas con alta prevalencia de cáncer, la ausencia de validación externa y la falta de transparencia sobre el umbral de positividad pueden producir resultados que no se reproducen en la práctica clínica. En cribado mamográfico, donde la prevalencia de cáncer es baja y el desafío principal consiste en detectar lesiones sutiles entre miles de estudios normales, el rendimiento de un algoritmo debe evaluarse en poblaciones representativas y con seguimiento suficiente para identificar cánceres de intervalo. Por ello, una revisión sistemática de exactitud diagnóstica debe analizar no solo los resultados numéricos, sino también la arquitectura metodológica que sostiene esos resultados.
La incorporación de guías específicas para estudios diagnósticos con IA refuerza esta necesidad. STARD-AI, publicada recientemente, establece criterios mínimos para el reporte transparente de estudios de exactitud diagnóstica que evalúan sistemas de IA, incluyendo aspectos como la descripción del algoritmo, los datos de entrenamiento, la independencia del conjunto de prueba, el manejo de datos faltantes, el umbral de decisión y la reproducibilidad del modelo (7). De forma complementaria, QUADAS-2 continúa siendo una herramienta esencial para valorar riesgo de sesgo y aplicabilidad en estudios de exactitud diagnóstica, especialmente en dominios como selección de pacientes, prueba índice, estándar de referencia y flujo temporal.
En este marco, la presente revisión sistemática tiene como objetivo evaluar el rendimiento diagnóstico de los sistemas de IA aplicados al screening del cáncer de mama mediante mamografía digital y tomosíntesis, en comparación con la lectura radiológica humana. Se analizaron desenlaces como sensibilidad, especificidad, área bajo la curva ROC, valores predictivos, tasa de detección de cáncer, tasa de falsos positivos y falsos negativos, utilizando como referencia estudios de exactitud diagnóstica publicados entre 2021 y 2026. Esta síntesis busca aportar evidencia crítica, actualizada y clínicamente útil para radiólogos, investigadores, gestores sanitarios y tomadores de decisiones interesados en la integración responsable de la IA en los programas de detección temprana del cáncer de mama.
Objetivos
Objetivo general
- Evaluar el rendimiento diagnóstico y la utilidad operativa de los sistemas de inteligencia artificial aplicados al cribado del cáncer de mama mediante mamografía digital y tomosíntesis digital mamaria, en comparación con la interpretación radiológica humana.
Objetivos específicos
- Comparar la sensibilidad, especificidad, área bajo la curva ROC, valores predictivos, tasa de detección de cáncer, tasa de rellamada y frecuencia de falsos positivos y falsos negativos de los sistemas de inteligencia artificial frente a la lectura radiológica convencional.
- Analizar el desempeño de la inteligencia artificial según la modalidad de imagen y su forma de integración en el flujo de trabajo, ya sea como lector independiente, segundo lector, herramienta de triaje o sistema de apoyo a la decisión diagnóstica, considerando su efecto sobre la carga de lectura y el tiempo de interpretación.
- Valorar la calidad metodológica, el riesgo de sesgo y la aplicabilidad clínica de los estudios incluidos, e identificar las principales limitaciones y brechas de evidencia relacionadas con la validación externa, los cánceres de intervalo, la equidad diagnóstica y la costo-efectividad.
Métodos
Diseño y registro del protocolo
Se realizó una revisión sistemática de estudios de exactitud diagnóstica orientada a evaluar el rendimiento de los sistemas de IA aplicados al cribado de cáncer de mama mediante mamografía digital y/o tomosíntesis digital mamaria. El reporte se estructuró conforme a PRISMA 2020 y PRISMA-DTA, con el propósito de fortalecer transparencia, reproducibilidad y valoración de aplicabilidad clínica. El protocolo fue elaborado previamente y registrado en PROSPERO con el código CRD420261369508. Las diferencias entre protocolo y revisión final se limitaron a la decisión de realizar síntesis narrativa, sin metaanálisis, debido a la heterogeneidad clínica, metodológica y tecnológica de los estudios incluidos.
Pregunta de investigación y marco PIRD
La pregunta se formuló mediante el marco PIRD para revisiones de exactitud diagnóstica. Se buscó responder si los sistemas de IA aplicados a mamografía digital o tomosíntesis digital mamaria ofrecen rendimiento diagnóstico comparable o superior al de la lectura radiológica humana en programas de cribado de cáncer de mama.
Ver tabla al final del artículo.
Tabla 1. Marco PIRD y criterios operacionales de la revisión.
Criterios de elegibilidad
Se incluyeron estudios originales publicados entre enero de 2021 y mayo de 2026, en inglés o español, que evaluaran sistemas de IA aplicados al cribado mamográfico y reportaran datos de exactitud diagnóstica o métricas operativas comparables con la lectura radiológica. Se excluyeron revisiones narrativas, revisiones sistemáticas, metaanálisis, editoriales, cartas, resúmenes de congresos sin texto completo, estudios puramente técnicos sin validación clínica, trabajos con bases exclusivamente de entrenamiento, estudios sin estándar de referencia verificable y estudios que no permitieran extraer sensibilidad, especificidad, AUC o desenlaces equivalentes. Los diseños de casos y controles o cohortes enriquecidas se consideraron solo para interpretación cualitativa debido al riesgo de sesgo de espectro.
Fuentes de información y estrategia de búsqueda
Se consultaron PubMed/MEDLINE, Embase, Scopus, Web of Science Core Collection, Cochrane Library, IEEE Xplore, ClinicalTrials.gov, WHO ICTRP, medRxiv, arXiv y Google Scholar. La última búsqueda se realizó el 17 de mayo de 2026. La estrategia combinó términos controlados y palabras libres relacionados con inteligencia artificial, aprendizaje automático, aprendizaje profundo, mamografía, tomosíntesis, cribado de cáncer de mama y exactitud diagnóstica.
La estrategia base para PubMed/MEDLINE fue: ("artificial intelligence"[MeSH Terms] OR "machine learning"[MeSH Terms] OR "deep learning"[Title/Abstract] OR "artificial intelligence"[Title/Abstract] OR "machine learning"[Title/Abstract] OR "neural network"[Title/Abstract] OR "convolutional neural network"[Title/Abstract] OR "computer-aided detection"[Title/Abstract] OR "AI-CAD"[Title/Abstract]) AND ("breast neoplasms"[MeSH Terms] OR "breast cancer"[Title/Abstract]) AND ("mammography"[MeSH Terms] OR "screening mammography"[Title/Abstract] OR "digital mammography"[Title/Abstract] OR "digital breast tomosynthesis"[Title/Abstract] OR "breast screening"[Title/Abstract]) AND ("diagnostic accuracy"[Title/Abstract] OR "sensitivity"[Title/Abstract] OR "specificity"[Title/Abstract] OR "ROC"[Title/Abstract] OR "AUC"[Title/Abstract] OR "cancer detection rate"[Title/Abstract] OR "recall rate"[Title/Abstract]) AND ("2021/01/01"[Date – Publication]: "2026/05/17"[Date – Publication]). Esta estrategia fue adaptada a cada base de datos según su sintaxis específica.
Selección de estudios
Extracción de datos
La extracción fue realizada por dos revisores mediante una matriz estandarizada. Se registraron autor, año, país, diseño, población, tamaño muestral, modalidad de imagen, algoritmo o sistema de IA, forma de integración en el flujo clínico, experiencia del lector humano, estándar de referencia, sensibilidad, especificidad, AUC, tasa de detección de cáncer, tasa de rellamada, falsos positivos, falsos negativos, valores predictivos y reducción de carga lectora. Cuando los estudios no reportaron tablas 2 × 2, estas no fueron imputadas; los datos faltantes se consignaron como no reportados.
Evaluación del riesgo de sesgo
La calidad metodológica se evaluó con QUADAS-2, considerando selección de pacientes, prueba índice, estándar de referencia y flujo/tiempo. Dado que el tema corresponde a IA aplicada a imagen médica, se incorporaron criterios complementarios de STARD-AI relacionados con descripción del algoritmo, independencia de la cohorte de validación, umbral de decisión, composición del conjunto de datos, reproducibilidad y sesgo algorítmico.
Síntesis de resultados
Los resultados se sintetizaron de forma narrativa y tabular. No se realizó metaanálisis debido a la heterogeneidad entre algoritmos, modalidades de imagen, diseño de los estudios, comparadores, estándares de referencia y puntos de corte. La síntesis distinguió estudios prospectivos, estudios retrospectivos, estudios multilector, estudios de implementación en práctica real, uso de IA como lector independiente, segundo lector, triaje o apoyo concurrente.
La búsqueda bibliográfica permitió identificar 2.184 registros. Tras la eliminación de duplicados y la aplicación de los criterios de selección, 94 artículos fueron evaluados a texto completo, de los cuales 12 estudios fueron incluidos en la revisión sistemática. Debido a la heterogeneidad de los estudios seleccionados, se realizó una síntesis narrativa de los resultados. El proceso completo de selección se presenta en la Figura 1.
Ver imagen al final del artículo.
Fig 1. Flujograma PRISMA.
Resultados
Ver tabla al final del artículo.
Tabla 2. Características metodológicas y resultados diagnósticos de los estudios incluidos que evaluaron la inteligencia artificial en programas de cribado de cáncer de mama.
Abreviaturas: IA: inteligencia artificial; AUC: área bajo la curva; DBT: tomosíntesis digital mamaria; CAD: detección asistida por computadora; PPV: valor predictivo positivo; NR: no reportado.
Ver tabla al final del artículo.
Tabla 3. Evaluación resumida del riesgo de sesgo y aplicabilidad mediante QUADAS-2. Los juicios sintetizan la información reportada por los estudios y deben interpretarse de forma cualitativa.
Discusión
En el ensayo MASAI, Lång et al. demostraron que una estrategia de cribado apoyada por IA detectó más cánceres que la doble lectura estándar y redujo aproximadamente 44,3% la carga de lectura radiológica, sin señales iniciales de deterioro en la seguridad diagnóstica (4). De forma complementaria, Dembrower et al. mostraron que la IA podía reemplazar de manera segura a uno de los dos lectores humanos en un diseño de no inferioridad dentro de un programa organizado de cribado, lo que representa una de las primeras demostraciones prospectivas de sustitución parcial del segundo lector humano (8). En Dinamarca, Lauritzen et al. documentaron una reducción de 33,5% en la carga de lectura acompañada de mejora en indicadores tempranos del programa tras la implementación de IA (11). A ello se suma el estudio PRAIM, en el que Eisemann et al. evaluaron 461.818 mujeres en 12 centros y observaron que la lectura asistida por IA incrementó la tasa de detección de cáncer de 5,7 a 6,7 por 1.000 mujeres, con una tasa de recall no inferior e incluso ligeramente menor que la del grupo control, además de un mayor valor predictivo positivo de la recall y de la biopsia (12). En un entorno distinto, pero igualmente relevante para muchos sistemas sanitarios, AI-STREAM mostró en Corea del Sur que la IA-CAD en lectura única aumentó la tasa de detección en 13,8% sin incrementos significativos en la tasa de recall, lo que refuerza su interés para contextos donde la doble lectura no está disponible de forma sistemática (17). No obstante, la evidencia no es universalmente favorable: Lee et al. encontraron sensibilidad y AUC muy similares con y sin IA, con una especificidad ligeramente menor en el grupo asistido, recordando que el beneficio clínico depende del algoritmo, del lector y del flujo de trabajo concreto en el que se inserta (13).
En mamografía digital, Romero-Martín et al. mostraron que la IA utilizada de forma independiente podía alcanzar un AUROC de 0,93, mientras que en tomosíntesis digital mamaria el AUROC ascendía a 0,94, con sensibilidad no inferior a la lectura humana en ambos entornos (9). Sin embargo, el comportamiento operativo no fue idéntico entre modalidades: en mamografía digital la IA pudo mantener sensibilidad con menor tasa de rellamada, mientras que en tomosíntesis la sensibilidad comparable no se tradujo siempre en mejor eficiencia, ya que el recall tendió a aumentar en los escenarios más sensibles (9). Esta diferencia es importante porque, desde el punto de vista radiológico, la utilidad de una herramienta no se juzga únicamente por su AUROC, sino por cómo modula el equilibrio entre detección y sobrecarga asistencial en cada modalidad.
La tomosíntesis merece una lectura específica. Aunque la DBT reduce el efecto de superposición tisular y mejora la conspicuidad de masas y distorsiones, también multiplica el volumen de imágenes por examen y, con ello, el tiempo de interpretación. En este contexto, el valor principal de la IA podría ser más operativo que sustitutivo. Shoshan et al. demostraron que un sistema de IA podía funcionar como filtro para excluir exámenes normales de DBT del trabajo del radiólogo, disminuyendo de forma significativa el número de estudios que requerían revisión humana (10). Kim et al., en un estudio multilector, observaron que un sistema categórico de IA mejoraba el rendimiento interpretativo en DBT, sobre todo entre radiólogos generales, lo que sugiere un efecto de estandarización y apoyo a la decisión más que de autonomía completa (15). Por su parte, Seker et al. reportaron que la IA como lector adicional alcanzó una sensibilidad de 72% y una especificidad de 93%, además de identificar retrospectivamente 23% de los cánceres visibles en mamografías previas que habían pasado inadvertidos en la lectura clínica inicial (14). En paralelo, Kwon et al. describieron que, en mujeres asiáticas sometidas a cribado, la IA mantuvo sensibilidad similar a la de los radiólogos, pero con mejor especificidad y menor tasa de rellamada, especialmente en determinados subgrupos de densidad mamaria (17). En conjunto, estos hallazgos sugieren que no existe una única respuesta a la pregunta de si la IA funciona mejor en mamografía digital o en tomosíntesis. Más bien, parece que su mejor papel varía según la modalidad: en mamografía digital es especialmente prometedora como segundo lector o apoyo a la lectura única; en DBT, hoy parece más sólida como herramienta de triaje, priorización y estandarización interpretativa. (9,14,16,20).
Un punto crucial en la discusión de alto nivel es que un aumento de la sensibilidad no equivale automáticamente a un mejor resultado clínico. La utilidad real de la IA depende del tipo de tumores que adelanta, de si reduce los cánceres que aparecerían como intervalares y de si evita un aumento desproporcionado de falsos positivos o de lesiones de bajo impacto biológico. La revisión sistemática y metaanálisis de Yoon et al. refiere que la IA independiente mostró globalmente una sensibilidad superior a la de los radiólogos, pero a costa de una especificidad inferior (19). Freeman et al., en una revisión metodológicamente rigurosa, advirtieron además que gran parte de la evidencia inicial estaba basada en estudios retrospectivos, cohortes enriquecidas y validaciones internas, con importantes preocupaciones de sesgo y aplicabilidad que limitaban la traslación directa de esos resultados al cribado poblacional real (6). Por eso, en imagenología mamaria, las diferencias de AUC, sensibilidad o especificidad solo son interpretables si se leen dentro del contexto de prevalencia, modalidad, forma de integración y calidad metodológica del estudio.
En ese marco, la aportación más convincente de la literatura reciente es que la IA no solo puede detectar más cánceres, sino que podría modificar el espectro tumoral detectado. AI-STREAM mostró que el uso de IA-CAD no aumentó únicamente el número total de cánceres detectados, sino también la detección de carcinoma ductal in situ, tumores invasivos, lesiones menores de 20 mm y enfermedad ganglionar negativa, lo que sugiere un desplazamiento hacia estadios más precoces del diagnóstico (5). De manera similar, PRAIM mostró no solo un incremento en la tasa de detección, sino también mejor valor predictivo positivo de recall y biopsia, lo que apunta a una mejor selección de casos verdaderamente relevantes por parte del flujo asistido por IA (4). El punto, en consecuencia, no es si la IA obtiene mejores curvas ROC en un conjunto de prueba, sino si ayuda a descubrir enfermedad clínicamente accionable sin multiplicar el daño potencial asociado a la rellamada, al sobrediagnóstico y a las biopsias innecesarias (6,12,17,20).
Probablemente la prueba clínica más exigente para cualquier tecnología de cribado siga siendo su efecto sobre los cánceres de intervalo. Estos tumores reflejan el límite verdadero de la sensibilidad del programa y, por su comportamiento biológico, tienen un peso clínico muy superior al de una simple mejora de AUC. En este sentido, Kelly et al. aportaron una evidencia especialmente robusta al demostrar, en una gran evaluación multicéntrica británica, que el sistema de IA alcanzó una sensibilidad superior al primer lector humano (0,541 frente a 0,437), con especificidad no inferior (0,943 frente a 0,952), elevó la tasa de detección de 7,54 a 9,33 por 1.000 mujeres y detectó retrospectivamente 25,0% de los cánceres de intervalo (20). Warren et al. mostraron que reemplazar al segundo lector por IA, incluyendo arbitraje, fue no inferior a la doble lectura humana en sensibilidad y especificidad, con una reducción aproximada de 46% en el volumen total de lecturas; sin embargo, también evidenciaron que el arbitraje humano, aunque mejoró la especificidad, anuló parte del potencial de la IA al sobreseer algunas señales correctas relacionadas con cánceres de intervalo o de ronda siguiente (21).
La densidad mamaria añade una capa adicional de complejidad. En la práctica diaria, la disminución de sensibilidad de la mamografía en mamas densas sigue siendo una de las razones más importantes de falsos negativos y de diagnóstico tardío. En los estudios incluidos en esta revisión, el comportamiento de la IA según densidad no fue homogéneo, pero sí clínicamente relevante. Kwon et al. sugirieron que la IA podía mantener sensibilidad con mejor especificidad y menos recalls en determinados subgrupos densos (17). Kelly et al. no encontraron señales sistemáticas de inequidad por edad, grupo étnico o densidad, aunque advirtieron que la estabilidad del punto de operación exigía recalibración local y vigilancia continua (20). Louis et al., en un despliegue norteamericano a gran escala basado en DBT y lectura única anual, comunicaron un incremento de 21,6% en la tasa de detección de 4,6 a 5,6 por 1.000 con incremento moderado del recall y sin disparidades detectables en CDR, RR o PPV1 según raza o densidad mamaria (22). Desde la perspectiva de la imagenología mamaria, esto es especialmente importante: una implementación responsable de IA no debe limitarse a mejorar promedios globales, sino demostrar que mantiene seguridad y equidad precisamente en los subgrupos donde la mamografía convencional falla con mayor frecuencia (19,21,22,23).
La evidencia reciente favorece de manera cada vez más clara los modelos híbridos de implementación. Frazer et al., al simular distintas rutas de integración en un programa poblacional australiano, mostraron que usar la IA como segundo lector o como filtro de alta confianza podía mejorar la sensibilidad entre 1,9% y 2,5%, aumentar la especificidad hasta 0,6%, reducir las evaluaciones entre 4,6% y 10,9% y disminuir el número de lecturas humanas entre 48% y 80,7% (23). Sin embargo, el mismo estudio también evidenció un punto poco discutido pero crucial: el sesgo de automatización. Cuando el lector humano tiende a seguir de forma acrítica la salida del algoritmo, la interacción humano-máquina puede degradar el rendimiento en sistemas multilector, aunque, paradójicamente, puede mejorar los resultados en contextos de lectura única (23).
Los resultados del ensayo AITIC refuerzan esa idea y añaden una dimensión particularmente útil para la comparación entre mamografía digital y DBT. En ese ensayo prospectivo, Elías-Cabot et al. evaluaron una estrategia parcialmente automatizada en la que los estudios de bajo riesgo podían omitirse de la lectura humana y los exámenes de mayor riesgo eran sometidos a lectura con apoyo de IA. El resultado fue una reducción de 63,6% en la carga radiológica, un incremento de 15,2% en la tasa de detección de 6,3 a 7,3 por 1.000 y un aumento de 14,8% en la tasa de recall global (24). Lo más interesante, sin embargo, fue el análisis por modalidad: en mamografía digital el beneficio se concentró en una mayor detección de cáncer acompañada de un aumento de recalls, mientras que en tomosíntesis tanto la tasa de detección como la de recall permanecieron relativamente estables (25). Desde la perspectiva clínica, esto sugiere que la mejor estrategia de despliegue no será idéntica para todas las modalidades. En programas con mamografía digital y lectura única, la IA puede actuar como una valiosa red de seguridad; en programas con doble lectura, puede reemplazar un lector o modular el triaje; y en DBT, al menos con la evidencia actual, parece más razonable pensar en un papel de priorización o apoyo concurrente antes que de decisión autónoma generalizada (24,25).
A medida que la evidencia se desplaza desde cohortes retrospectivas hacia estudios prospectivos y de implementación real, la exigencia metodológica también debe aumentar. En un campo como la IA diagnóstica, donde el brillo de la AUROC puede ocultar problemas de selección, validación y generalización, no basta con informar sensibilidad y especificidad. STARD-AI ha venido a formalizar lo que la radiología necesitaba: una descripción transparente del algoritmo, del origen y partición de los datos, del umbral de decisión, de las actualizaciones del modelo, de la validación externa y de las consideraciones de sesgo y equidad (7). Leída a la luz de QUADAS-2, la revisión de Freeman et al. sigue siendo plenamente vigente: muchos estudios iniciales de IA en mamografía sobreestimaron el rendimiento al apoyarse en cohortes seleccionadas, diseños enriquecidos y estándares de referencia incompletos (6).
Las implicaciones operativas y económicas tampoco son menores. Ahsen et al. modelaron distintos esquemas de reparto de tareas entre IA y radiólogos y concluyeron que la estrategia de delegación podía generar ahorros de 17,5% a 30,1% en comparación con un modelo basado exclusivamente en expertos humanos (25). Hill y Roadevin, ya con un enfoque de evaluación económica ligado a datos prospectivos del programa británico, estimaron que tanto la sustitución de uno de los lectores por IA como incluso la estrategia de IA sola podían ofrecer pequeñas ganancias en QALY y reducciones de costo a lo largo de la vida, siendo la sustitución completa la opción con mayor probabilidad de costo-efectividad en su modelo (26). En ese mismo sentido, Ahmadzade et al. mostraron que la IA puede mejorar la concordancia interobservador e intraobservador, especialmente entre radiólogos generales, lo que sugiere un efecto de estandarización clínica particularmente valioso en entornos con acceso limitado a subespecialistas en mama (27-30).
Conclusiones
La presente revisión sistemática demuestra que la inteligencia artificial aplicada al screening del cáncer de mama mediante mamografía digital y tomosíntesis constituye una herramienta diagnóstica con potencial clínico significativo para mejorar el rendimiento de los programas de cribado. La evidencia analizada indica que los sistemas de IA pueden alcanzar una sensibilidad comparable o superior a la lectura radiológica convencional, manteniendo niveles aceptables de especificidad y contribuyendo al incremento de la tasa de detección de cáncer en distintos escenarios clínicos.
Los mayores beneficios se observaron cuando la IA fue integrada como segundo lector, herramienta de apoyo a la lectura única o sistema de triaje, más que como sustituto completo del radiólogo. Los estudios prospectivos y de implementación en práctica real mostraron reducciones sustanciales en la carga de trabajo radiológica, acompañadas de mejoras en la detección de lesiones malignas clínicamente relevantes, incluyendo tumores invasivos de pequeño tamaño y cánceres potencialmente detectables en etapas más tempranas.
La mamografía digital fue la modalidad en la que la IA mostró los resultados más consistentes en términos de exactitud diagnóstica y eficiencia operativa. En tomosíntesis digital mamaria, aunque los algoritmos demostraron un rendimiento prometedor, la evidencia actual sugiere un papel más orientado al soporte diagnóstico, la priorización de estudios y la optimización del flujo de trabajo que al reemplazo de la interpretación humana.
A pesar de estos hallazgos favorables, persisten importantes desafíos relacionados con la heterogeneidad de los algoritmos, la variabilidad entre poblaciones, la necesidad de validación externa y la limitada evidencia sobre desenlaces a largo plazo, como la reducción de cánceres de intervalo y mortalidad específica. Asimismo, la implementación clínica debe realizarse bajo estándares metodológicos rigurosos, incluyendo evaluación continua del rendimiento, transparencia algorítmica y supervisión especializada.
En conclusión, la evidencia disponible respalda la incorporación progresiva de la inteligencia artificial como complemento de la interpretación radiológica en programas de cribado mamográfico. Sin embargo, su utilización debe enmarcarse dentro de modelos de inteligencia aumentada, donde la experiencia del radiólogo y las capacidades analíticas de la IA actúen de manera complementaria para optimizar la detección temprana del cáncer de mama, mejorar la eficiencia de los servicios de imagen y favorecer una atención más precisa, segura y equitativa para las pacientes.
Lista de abreviaturas:
IA: inteligencia artificial; IA-CAD: artificial intelligence computer-aided detection; AUC: área bajo la curva; AUROC: área bajo la curva característica operativa del receptor; CDR: cancer detection rate; DBT: tomosíntesis digital mamaria; DM: mamografía digital; PPV: valor predictivo positivo; PPV1: valor predictivo positivo de la rellamada; QUADAS-2: Quality Assessment of Diagnostic Accuracy Studies-2; PRISMA: Preferred Reporting Items for Systematic Reviews and Meta-Analyses; PRISMA-DTA: extensión PRISMA para pruebas diagnósticas; RR: recall rate; STARD-AI: Standards for Reporting Diagnostic Accuracy Studies involving Artificial Intelligence.
Declaración de conflicto de interés: La autora declara no tener conflictos de interés financieros, académicos ni personales relacionados con el contenido de este manuscrito.
Financiamiento: La presente investigación fue realizada con recursos propios de la autora. No se recibió financiamiento externo por parte de instituciones públicas, privadas, organizaciones sin fines de lucro ni entidades comerciales para el diseño, desarrollo, análisis, redacción o publicación de este estudio.
Contribuciones de autoría: Nieto Espinoza Lisette Estephanie: conceptualización, metodología, investigación, búsqueda bibliográfica, selección de estudios, curación de datos, análisis formal, síntesis e interpretación de resultados, redacción del borrador original, revisión crítica, edición final del manuscrito y administración del proyecto.
Ética y consentimiento: El presente trabajo corresponde a una revisión sistemática de estudios publicados, por lo que no implicó intervención directa en seres humanos, acceso a datos personales identificables ni procedimientos diagnósticos o terapéuticos sobre pacientes. En consecuencia, no requirió aprobación por un comité de ética en investigación ni consentimiento informado individual. El protocolo fue elaborado previamente y remitido a PROSPERO, y el proceso metodológico del manuscrito se estructuró conforme al marco descrito por la autora para revisiones sistemáticas de exactitud diagnóstica.
Bibliografía
- Bray F, Laversanne M, Sung H, Ferlay J, Siegel RL, Soerjomataram I, Jemal A. Global cancer statistics 2022: GLOBOCAN estimates of incidence and mortality worldwide for 36 cancers in 185 countries. CA Cancer J Clin. 2024;74(3):229-263. doi: 10.3322/caac.21834.
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021;71(3):209-249. doi: 10.3322/caac.21660.
- International Agency for Research on Cancer. Global Cancer Observatory. Lyon: IARC; 2024.
- Lång K, Josefsson V, Larsson AM, Larsson S, Högberg C, Sartor H, Hofvind S, Andersson I, Rosso A. Artificial intelligence-supported screen reading versus standard double reading in the Mammography Screening with Artificial Intelligence trial (MASAI): a clinical safety analysis of a randomised, controlled, non-inferiority, single-blinded, screening accuracy study. Lancet Oncol. 2023;24(8):936-944. doi: 10.1016/S1470-2045(23)00298-X.
- Eisemann N, Bunk S, Mukama T, Baltus H, Elsner SA, Gomille T, Hecht G, Heywang-Köbrunner S, Rathmann R, Siegmann-Luz K, Töllner T, Vomweg TW, Leibig C, Katalinic A. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening. Nat Med. 2025;31(3):917-924. doi: 10.1038/s41591-024-03408-6.
- Freeman K, Geppert J, Stinton C, Todkill D, Johnson S, Clarke A, Philips S. Use of artificial intelligence for image analysis in breast cancer screening programmes: systematic review of test accuracy. BMJ. 2021;374:n1872.
- Sounderajah V, Guni A, Liu X, Collins GS, Karthikesalingam A, Markar SR, Golub RM, Denniston AK, Shetty S, Moher D, Bossuyt PM, Darzi A, Ashrafian H; STARD-AI Steering Committee. The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence. Nat Med. 2025;31(10):3283-3289. doi: 10.1038/s41591-025-03953-8.
- Dembrower K, Crippa A, Colón E, Eklund M, Strand F. Artificial intelligence for breast cancer detection in screening mammography in Sweden: a prospective, population-based, paired-reader, non-inferiority study. Lancet Digit Health. 2023;5(10):e703-e711.
- Romero-Martín S, Elías-Cabot E, Raya-Povedano JL, Gubern-Mérida A, Rodríguez-Ruiz A, Álvarez-Benito M. Stand-Alone Use of Artificial Intelligence for Digital Mammography and Digital Breast Tomosynthesis Screening: A Retrospective Evaluation. Radiology. 2022;302(3):535-542. doi: 10.1148/radiol.211590.
- Shoshan Y, Bakalo R, Gilboa-Solomon F, Ratner V, Barkan E, Ozery-Flato M, Amit M, Khapun D, Ambinder EB, Oluyemi ET, Panigrahi B, DiCarlo PA, Rosen-Zvi M, Mullen LA. Artificial Intelligence for Reducing Workload in Breast Cancer Screening with Digital Breast Tomosynthesis. Radiology. 2022;303(1):69-77. doi: 10.1148/radiol.211105.
- Lauritzen AD, Lillholm M, Lynge E, Nielsen M, Karssemeijer N, Vejborg I. Early Indicators of the Impact of Using AI in Mammography Screening for Breast Cancer. Radiology. 2024;311(3):e232479. doi: 10.1148/radiol.232479.
- Eisemann N, Bunk S, Mukama T, Baltus H, Elsner A, Gomille T, Hecht G, Heywang S, Rathmann R, Siegmann K, Töllner T, Werner T, Leibig C, Katalinic A. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening. Nat Med. 2025;31(3):917-924.
- Lee SE, Hong H, Kim EK. Diagnostic performance with and without artificial intelligence assistance in real-world screening mammography. Eur J Radiol Open. 2024;12:100545. doi: 10.1016/j.ejro.2023.100545.
- Seker ME, Koyluoglu YO, Ozaydin AN, Gurdal SO, Ozcinar B, Cabioglu N, Ozmen V, Aribal E. Diagnostic capabilities of artificial intelligence as an additional reader in a breast cancer screening program. Eur Radiol. 2024;34(9):6145-6157. doi: 10.1007/s00330-024-10661-3.
- Kim JG, Haslam B, Diab AR, Sakhare A, Grisot G, Lee H, Holt J, Lee CI, Lotter W, Sorensen AG. Impact of a Categorical AI System for Digital Breast Tomosynthesis on Breast Cancer Interpretation by Both General Radiologists and Breast Imaging Specialists. Radiol Artif Intell. 2024;6(2):e230137. doi: 10.1148/ryai.230137.
- Chang YW, Ryu JK, An JK, Choi N, Park YM, Ko KH, Han K. Artificial intelligence for breast cancer screening in mammography (AI-STREAM): preliminary analysis of a prospective multicenter cohort study. Nat Commun. 2025;16(1):2248. doi: 10.1038/s41467-025-57469-3.
- Kwon MR, Chang Y, Ham SY, Cho Y, Kim EY, Kang J, Park EK, Kim KH, Kim M, Kim TS, Lee H, Kwon R, Lim GY, Choi HR, Choi J, Kook SH, Ryu S. Screening mammography performance according to breast density: a comparison between radiologists versus standalone intelligence detection. Breast Cancer Res. 2024; 26(1):68. doi: 10.1186/s13058-024-01821-w.
- Park EK, Kwak S, Lee W, Choi JS, Kooi T, Kim EK. Impact of AI for digital breast tomosynthesis on breast cancer detection and interpretation time. Radiol Artif Intell. 2024;6(3):e230318. doi:10.1148/ryai.230318.
- Yoon JH, Strand F, Baltzer PAT, Conant EF, Gilbert FJ, Lehman CD, Morris EA, Mullen LA, Nishikawa RM, Sharma N, Vejborg I, Moy L, Mann RM. Standalone AI for Breast Cancer Detection at Screening Digital Mammography and Digital Breast Tomosynthesis: A Systematic Review and Meta-Analysis. Radiology. 2023;307(5):e222639. doi: 10.1148/radiol.222639.
- Kelly CJ, Wilson M, Warren LM, Sidebottom R, Halling-Brown M, Yang L, Morigami M, Venton J, Chopra R, Chang J, Dixon J, Gilbert FJ, Golden DI, Gruzewska E, Honeyfield L, Hujan A, Khodabakhshi D, Lewis E, Malhotra N, Mallya R, Ogunleye D, Purdy C, Sayres R, Sieniek M, Stoycheva T, Sy A, Thomas S, Ward D, Xi L, Xu S, Shetty S, Darzi A, Young K, Purushothaman H, Khoo L, Reddy M, Ashrafian H, Cunningham D. Diagnostic accuracy, fairness and clinical implementation of AI for breast cancer screening: results of multicenter retrospective and prospective technical feasibility studies. Nat Cancer. 2026;7(3):494-506. doi: 10.1038/s43018-026-01127-0.
- Warren LM, Venton J, Young KC, Halling-Brown M, Kelly CJ, Wilson M, Morigami M, Khoo L, Cunningham D, Sidebottom R, Reddy M, Purushothaman H, Khodabakhshi D, Honeyfield L, Hujan A, Stoycheva T, Joiner A, Chopra R, Sy A, Ward D, Yang L, Sayres R, Golden D, Malhotra N, Mallya R, Xi L, Ogunleye D, Purdy C, Mackenzie A, Thomas S, Shetty S, Gilbert FJ, Darzi A, Ashrafian H. Impact of using artificial intelligence as a second reader in breast screening including arbitration. Nat Cancer. 2026;7(3):507-521. doi: 10.1038/s43018-026-01128-z.
- Louis LD, Wakelin EA, McCabe MP, Ng AY, Kim JG, Lee CI, Buist D, Sorensen A, Haslam B. Equitable impact of an AI-driven breast cancer screening workflow in real-world US-wide deployment. Nat Health. 2026;1:58-66.
- Frazer HML, Peña-Solorzano CA, Kwok CF, Elliott MS, Chen Y, Wang C; BRAIx Team; Lippey JF, Hopper JL, Brotchie P, Carneiro G, McCarthy DJ. Comparison of AI-integrated pathways with human-AI interaction in population mammographic screening for breast cancer. Nat Commun. 2024;15(1):7525. doi: 10.1038/s41467-024-51725-8.
- Elías-Cabot E, Romero-Martín S, Raya-Povedano JL, Rodríguez-Ruiz A, Álvarez-Benito M. AI-based triage and decision support in mammography and digital tomosynthesis for breast cancer screening: a paired, noninferiority trial. Nat Med. 2026;32(4):1296-1305. doi: 10.1038/s41591-026-04277-x.
- Ahsen ME, Ayvaci MUS, Mookerjee R, Stolovitzky G. Economics of AI and human task sharing for decision making in screening mammography. Nat Commun. 2025;16(1):2289. doi: 10.1038/s41467-025-57409-1.
- Hill H, Roadevin C. Economic evaluation of artificial intelligence for cancer detection in the UK breast screening programme. Br J Cancer. 2026. doi:10.1038/s41416-026-03465-3.
- Ahmadzade M, Rouientan H, Abdi N, Norouzi M, Hakimi M, Bahrambeigi M, Khalili Pouya E, Bahmanyar F, Haghi S, Abbasi F, Madadi H, Bakhtavar K, Laalinia H, Ahmadinejad N, Rabiee P, Moosavian F, Akhlaghpoor S. AI assistance improves reader agreement in digital mammography: A multireader crossover study of general and breast subspecialty radiologists. Sci Rep. 2025;16(1):1370. doi: 10.1038/s41598-025-31065-3.
- Park EK, Kwak S, Lee W, Choi JS, Kooi T, Kim EK. Impact of AI for Digital Breast Tomosynthesis on Breast Cancer Detection and Interpretation Time. Radiol Artif Intell. 2024;6(3):e230318. doi: 10.1148/ryai.230318.
- Chen IE, Joines MM, Capiro N, Dawar R, Sears C, Sayre J, Chalfant J, Fischer C, Hoyt AC, Hsu W, Milch HS. Commercial Artificial Intelligence Versus Radiologists: NPV and Recall Rate in Large Population-Based Digital Mammography and Tomosynthesis Screening Mammography Cohorts. AJR Am J Roentgenol. 2025;225(6):e2532889. doi: 10.2214/AJR.25.32889.
- Gommers J, Hernström V, Josefsson V, Sartor H, Schmidt D, Hjelmgren A, Larsson AM, Hofvind S, Andersson I, Rosso A, Hagberg O, Lång K. Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading without AI in the MASAI study: a randomised, controlled, non-inferiority, single-blinded, population-based, screening-accuracy trial. Lancet. 2026;407(10527):505-514. doi: 10.1016/S0140-6736(25)02464-X.



