Índice
- 1 Resumen
- 2 Introducción
- 3 Objetivos
- 4 Métodos
- 4.1 Diseño y registro del protocolo
- 4.2 Pregunta de investigación en formato PIRD
- 4.3 Fuentes de información y estrategia de búsqueda
- 4.4 Criterios de elegibilidad
- 4.5 Selección de estudios y extracción de datos
- 4.6 Riesgo de sesgo y certeza de la evidencia
- 4.7 Síntesis de resultados y análisis estadístico
- 5 Resultados
- 6 Discusión
- 7 Conclusiones
- 8 Bibliografía
- 9 Anexos: PDF
Incluido en la revista Ocronos. Vol. IX. N.º 9–Septiembre 2026.
Pág. Inicial: Vol. IX; N.º 9: 72
Autor principal (primer firmante): Gina Carolina Villigua Vásquez
Fecha recepción: 04/08/2026
Fecha aceptación: 31/08/2026
Ref.: Ocronos. 2026;9(9): 72
https://doi.org/10.58842/AVJQ2561
Autores:
Gina Carolina Villigua Vásquez
https://orcid.org/0000-0063-4962-9782
Diana Elena Parra Muñoz
https://orcid.org/0000-0003-0983-4100
José Patricio Beltrán Carreño
https://orcid.org/0000-0002-1972-0812
Categoría profesional
Medico posgradista de imagenología.
Especialista en imagenología.
Especialista en medicina familiar, Magister en gerencia de instituciones de salud, Magister en investigación de la salud.
Resumen
- Antecedentes: La artrosis de rodilla es una causa frecuente de dolor, limitación funcional y discapacidad musculoesquelética. Su diagnóstico precoz continúa siendo un desafío clínico, especialmente en estadios iniciales, cuando los hallazgos radiográficos pueden ser sutiles o inconsistentes. La inteligencia artificial (IA), particularmente los modelos de aprendizaje profundo, ha sido propuesta como herramienta de apoyo para estandarizar la lectura imagenológica y mejorar la detección de patrones estructurales.
- Objetivo: Evaluar la precisión diagnóstica de algoritmos de IA aplicados principalmente a radiografía convencional de rodilla y, de forma exploratoria, a tomografía computarizada, frente a estándares radiográficos o interpretación experta para el diagnóstico precoz o la clasificación de artrosis en pacientes sintomáticos.
- Métodos: Se realizó una revisión sistemática de estudios de precisión diagnóstica siguiendo PRISMA-DTA. El protocolo fue registrado en PROSPERO (CRD420261345323). La búsqueda se efectuó en PubMed/MEDLINE, Scopus, Web of Science Core Collection, IEEE Xplore y Google Scholar, desde enero de 2021 hasta el 15 de mayo de 2026. Se incluyeron estudios originales que evaluaran IA aplicada a radiografía o tomografía computarizada de rodilla y reportaran métricas diagnósticas. El riesgo de sesgo se evaluó con QUADAS-2 y la certeza de la evidencia con GRADE. Debido a la heterogeneidad clínica y metodológica, se realizó síntesis narrativa.
- Conclusiones: La IA aplicada a radiografías de rodilla muestra potencial como apoyo diagnóstico, especialmente para estandarizar la clasificación radiográfica y reducir variabilidad interobservador. No obstante, su utilidad para diagnóstico precoz sigue siendo incierta por heterogeneidad, limitada validación externa y escasa evidencia en tomografía computarizada. Se requieren estudios prospectivos, multicéntricos y validados externamente antes de recomendar su implementación clínica generalizada.
Palabras clave
Artrosis de rodilla; inteligencia artificial; aprendizaje profundo; radiografía; tomografía computarizada; precisión diagnóstica; diagnóstico precoz; revisión sistemática.
Introducción
La artrosis de rodilla es una enfermedad articular crónica, progresiva y multifactorial que constituye una de las principales causas de dolor, limitación funcional y discapacidad musculoesquelética en adultos y adultos mayores. Actualmente se reconoce como una enfermedad de toda la articulación, en la que no solo existe degeneración del cartílago hialino, sino también remodelación del hueso subcondral, formación de osteofitos, alteraciones meniscales, sinovitis de bajo grado, cambios ligamentarios y compromiso de la cápsula articular (1). Esta concepción integral ha desplazado la visión clásica de la artrosis como un proceso exclusivamente degenerativo del cartílago, permitiendo comprenderla como una entidad dinámica en la que interactúan factores biomecánicos, metabólicos, inflamatorios, genéticos y relacionados con el envejecimiento (2).
Desde una perspectiva epidemiológica, la carga global de la artrosis ha aumentado de forma sostenida durante las últimas décadas. El estudio Global Burden of Disease 2021 estimó que aproximadamente 595 millones de personas vivían con artrosis en 2020, lo que representa cerca del 7,6 % de la población mundial, con un incremento superior al 130 % desde 1990 (2). Dentro de las localizaciones anatómicas afectadas, la rodilla constituye una de las más frecuentes y clínicamente relevantes, debido a su papel fundamental en la marcha, la bipedestación, la independencia funcional y la calidad de vida (3,4). Las proyecciones epidemiológicas indican que para 2050 la carga de artrosis continuará aumentando de forma considerable, impulsada principalmente por el envejecimiento poblacional, el incremento de la obesidad y la mayor supervivencia de personas con enfermedades crónicas (2).
En América Latina, la artrosis de rodilla representa un problema sanitario de creciente importancia. Diversos estudios regionales han mostrado una elevada prevalencia de dolor musculoesquelético y enfermedad articular degenerativa, con impacto relevante en la productividad laboral, la movilidad y los costos familiares asociados al cuidado de la salud (4). En Ecuador, el estudio COPCORD realizado en Cuenca reportó una prevalencia elevada de trastornos musculoesqueléticos en la población adulta, con predominio en mujeres y adultos mayores, lo que evidencia la pertinencia de fortalecer estrategias diagnósticas oportunas en el contexto nacional (5). Esta realidad adquiere especial importancia en sistemas de salud con recursos limitados, donde el acceso a métodos avanzados como la resonancia magnética puede ser restringido y la radiografía convencional continúa siendo la herramienta diagnóstica más disponible.
El diagnóstico precoz de la artrosis de rodilla constituye un objetivo clínico relevante porque las intervenciones no farmacológicas, farmacológicas y de modificación de factores de riesgo son más efectivas cuando se instauran antes de que exista daño estructural avanzado. En etapas tempranas, correspondientes con frecuencia a los grados 0–2 de Kellgren-Lawrence, los hallazgos radiográficos pueden ser mínimos o incluso ausentes, a pesar de que el paciente presente dolor, rigidez o limitación funcional (6). Esta discordancia clínico-radiológica representa uno de los principales desafíos en la práctica imagenológica, ya que la radiografía convencional evalúa de forma indirecta el cartílago mediante signos secundarios como estrechamiento del espacio articular, osteofitos, esclerosis subcondral y quistes óseos (7).
A pesar de sus limitaciones, la radiografía convencional sigue siendo el método de primera línea para la evaluación inicial de la artrosis de rodilla por su bajo costo, amplia disponibilidad, rapidez y utilidad para clasificar la severidad radiográfica mediante escalas como Kellgren-Lawrence u OARSI (6,7). No obstante, su sensibilidad para detectar cambios iniciales es limitada, especialmente cuando predominan alteraciones del cartílago, meniscos, médula ósea o membrana sinovial. La interpretación radiográfica también puede presentar variabilidad interobservador, particularmente en grados intermedios de severidad, lo que afecta la reproducibilidad diagnóstica y puede retrasar la identificación de enfermedad temprana (8).
La tomografía computarizada, por su parte, ofrece una mayor resolución espacial y permite una valoración tridimensional más precisa de las estructuras óseas, por lo que puede aportar información relevante sobre osteofitos, esclerosis subcondral, alineación ósea y cambios estructurales complejos. Sin embargo, su papel en el diagnóstico rutinario de artrosis de rodilla es más limitado que el de la radiografía y la resonancia magnética, debido a la exposición a radiación ionizante, el costo relativo y su menor capacidad para caracterizar tejidos blandos en comparación con la resonancia (9). Aun así, en escenarios específicos, la tomografía puede proporcionar datos morfológicos valiosos y constituir una modalidad susceptible de análisis automatizado mediante inteligencia artificial.
En los últimos años, la IA ha emergido como una herramienta de alto potencial en radiología musculoesquelética, particularmente por su capacidad para analizar grandes volúmenes de imágenes, reconocer patrones complejos y detectar características sutiles que pueden pasar inadvertidas en la evaluación visual convencional. Los algoritmos de aprendizaje automático y, especialmente, de aprendizaje profundo han sido aplicados a radiografías de rodilla para clasificar la severidad de la artrosis, estimar el grado de Kellgren-Lawrence, segmentar estructuras anatómicas, cuantificar el espacio articular y predecir patrones de progresión estructural (10,11).
Los modelos basados en redes neuronales convolucionales, como ResNet, DenseNet, VGG, EfficientNet y U-Net, han mostrado resultados prometedores en la clasificación automatizada de la artrosis de rodilla. Estudios recientes han reportado valores elevados de exactitud diagnóstica y área bajo la curva ROC, especialmente en tareas de clasificación binaria entre rodillas normales y rodillas con artrosis establecida (10,12). Asimismo, investigaciones recientes han demostrado que la asistencia mediante IA puede mejorar el rendimiento de lectores menos experimentados e incrementar la concordancia interobservador en la graduación radiográfica de artrosis de rodilla (8). Este punto es particularmente relevante para la práctica clínica, ya que la IA no necesariamente reemplaza al especialista, sino que puede funcionar como una herramienta de apoyo para reducir la variabilidad, estandarizar la lectura y optimizar los flujos de trabajo radiológico.
Sin embargo, el entusiasmo por la IA debe interpretarse con cautela. Aunque numerosos estudios muestran resultados favorables, persisten limitaciones metodológicas importantes. Una proporción considerable de modelos se ha entrenado y validado en bases de datos públicas altamente estructuradas, como la Osteoarthritis Initiative o MOST, lo que puede limitar su aplicabilidad en escenarios clínicos reales con mayor heterogeneidad de pacientes, equipos de imagen, protocolos de adquisición y calidad radiográfica (13). Además, muchos estudios presentan validación externa insuficiente, tamaños muestrales variables, riesgo de sobreajuste, escasa transparencia algorítmica y limitada evaluación de sesgos relacionados con edad, sexo, índice de masa corporal o procedencia étnica (14).
Otro aspecto crítico es que la mayoría de las investigaciones se concentra en la clasificación de artrosis radiográfica establecida, mientras que la evidencia específica sobre diagnóstico precoz continúa siendo menos robusta. Detectar artrosis temprana exige identificar cambios estructurales sutiles, a menudo previos a la reducción evidente del espacio articular o a la aparición clara de osteofitos. En este escenario, los algoritmos de IA podrían aportar valor al reconocer patrones de textura ósea, microarquitectura subcondral, alineación articular y características radiográficas de difícil apreciación visual (15). No obstante, para considerar su implementación clínica, estos modelos deben demostrar no solo alto rendimiento estadístico, sino también validez externa, interpretabilidad, reproducibilidad y utilidad en la toma de decisiones.
Por tanto, el objetivo de esta revisión sistemática es evaluar y comparar la precisión diagnóstica de algoritmos de inteligencia artificial aplicados a radiografía convencional y tomografía computarizada de rodilla frente a la interpretación convencional para el diagnóstico precoz de artrosis en pacientes sintomáticos, considerando métricas como sensibilidad, especificidad, valores predictivos, razones de verosimilitud y área bajo la curva ROC. Esta síntesis busca aportar evidencia actualizada, metodológicamente rigurosa y clínicamente pertinente para orientar futuras investigaciones, fortalecer la práctica radiológica basada en evidencia y explorar el potencial de la IA en contextos sanitarios donde el diagnóstico temprano continúa siendo un desafío.
Objetivos
Objetivo general
- Evaluar la precisión diagnóstica de los algoritmos de inteligencia artificial aplicados a la radiografía convencional y la tomografía computarizada de rodilla para la detección precoz de artrosis en pacientes adultos sintomáticos, en comparación con la interpretación de especialistas y los estándares radiográficos de referencia.
Objetivos específicos
- Identificar y caracterizar los algoritmos de inteligencia artificial utilizados en radiografías convencionales y tomografías computarizadas de rodilla, considerando sus arquitecturas, poblaciones evaluadas, modalidades de imagen y estándares diagnósticos de referencia.
- Comparar el rendimiento diagnóstico de los algoritmos de inteligencia artificial mediante sensibilidad, especificidad, exactitud, valores predictivos, razones de verosimilitud y área bajo la curva ROC, con especial énfasis en los estadios iniciales de la artrosis de rodilla, correspondientes a los grados 0–2 de Kellgren-Lawrence.
- Analizar la calidad metodológica y la aplicabilidad clínica de la evidencia disponible, considerando el riesgo de sesgo, la certeza de la evidencia, la validación externa, la heterogeneidad entre los estudios y las principales limitaciones para la implementación de estos sistemas en la práctica clínica.
Métodos
Diseño y registro del protocolo
Se realizó una revisión sistemática de estudios de precisión diagnóstica orientada a evaluar el rendimiento de algoritmos de IA aplicados a radiografía convencional y tomografía computarizada de rodilla. El diseño se estructuró conforme a PRISMA-DTA para revisiones sistemáticas de pruebas diagnósticas. El protocolo fue registrado previamente en PROSPERO con el identificador CRD420261345323. La última búsqueda bibliográfica se efectuó el 15 de mayo de 2026.
Pregunta de investigación en formato PIRD
Ver tabla al final del artículo.
Tabla 1. Pregunta de investigación estructurada en formato PIRD.
Fuentes de información y estrategia de búsqueda
La búsqueda bibliográfica se realizó en PubMed/MEDLINE, Scopus, Web of Science Core Collection, IEEE Xplore y Google Scholar, complementada con revisión manual de referencias de estudios relevantes. Se utilizaron términos MeSH, palabras libres y operadores booleanos relacionados con artrosis de rodilla, IA, radiografía, tomografía computarizada y precisión diagnóstica. El intervalo de búsqueda fue enero de 2021 a 15 de mayo de 2026. En Google Scholar se revisaron los primeros 200 resultados ordenados por relevancia.
La estrategia base fue: (“knee osteoarthritis” OR “Osteoarthritis, Knee” OR gonarthrosis) AND (“artificial intelligence” OR “machine learning” OR “deep learning” OR “convolutional neural network” OR CNN OR algorithm) AND (“radiography” OR “X-ray” OR “computed tomography” OR CT) AND (“diagnostic accuracy” OR sensitivity OR specificity OR ROC OR AUC).
Ver tabla al final del artículo.
Tabla 2. Estrategias de búsqueda por base de datos.
Criterios de elegibilidad
Se incluyeron estudios originales publicados en inglés o español entre enero de 2021 y el 15 de mayo de 2026, con diseño transversal, retrospectivo, prospectivo, de cohortes, validación algorítmica o precisión diagnóstica, siempre que evaluaran IA aplicada a radiografía o tomografía computarizada de rodilla y reportaran al menos una métrica de rendimiento diagnóstico. Se aceptaron sensibilidad, especificidad, exactitud, valores predictivos, razones de verosimilitud, AUC, F1-score, kappa o métricas equivalentes cuando permitieran interpretar desempeño diagnóstico.
Se excluyeron revisiones narrativas, editoriales, cartas al editor, resúmenes sin texto completo, estudios exclusivamente basados en resonancia magnética, investigaciones centradas solo en progresión sin diagnóstico inicial, trabajos sobre otras articulaciones, estudios pediátricos, publicaciones sin estándar de referencia claro y estudios sin métricas diagnósticas interpretables.
Selección de estudios y extracción de datos
La selección se desarrolló en dos fases. Primero, dos revisores independientes examinaron títulos y resúmenes, clasificando cada registro como incluido, excluido o dudoso. Posteriormente, los textos completos potencialmente elegibles fueron evaluados de forma independiente. Las discrepancias se resolvieron por consenso y, cuando persistieron, mediante consulta con un tercer revisor. Se calculó el coeficiente kappa de Cohen para estimar concordancia interevaluador.
La extracción de datos se realizó por duplicado mediante una matriz estandarizada previamente pilotada. Se recopilaron autor, año, país, diseño, tamaño muestral, características de la población, modalidad de imagen, tipo de algoritmo, base de datos, estándar de referencia, sensibilidad, especificidad, AUC, exactitud, comparador clínico y limitaciones. Las discrepancias de extracción se resolvieron por consenso.
Riesgo de sesgo y certeza de la evidencia
El riesgo de sesgo se evaluó con QUADAS-2, considerando selección de pacientes, prueba índice, estándar de referencia y flujo/tiempo, además de la aplicabilidad clínica. Dos revisores realizaron la evaluación de forma independiente y las diferencias se resolvieron por consenso. La certeza global de la evidencia se valoró con GRADE para estudios de exactitud diagnóstica, considerando riesgo de sesgo, inconsistencia, evidencia indirecta, imprecisión y posible sesgo de publicación.
Síntesis de resultados y análisis estadístico
La síntesis fue narrativa y tabular. No se realizó metaanálisis bivariado ni modelo HSROC porque los estudios incluidos mostraron heterogeneidad clínica y metodológica sustancial en población, arquitectura algorítmica, modalidad de imagen, estándar de referencia, umbrales diagnósticos y métricas reportadas. Además, varios estudios no proporcionaron matrices 2 x 2 ni sensibilidad/especificidad desagregadas por categoría diagnóstica. Por tanto, no se presentan estimaciones agrupadas, forest plots ni curva HSROC.
El análisis se centró en comparar descriptivamente exactitud, sensibilidad, especificidad, AUC, concordancia y desempeño por grado de Kellgren-Lawrence cuando estuvieron disponibles. La extracción/síntesis se organizó en una matriz estandarizada en hoja de cálculo; no se emplearon paquetes de metaanálisis por no haberse efectuado síntesis cuantitativa.
Se identificaron 539 registros mediante búsqueda sistemática en bases de datos electrónicas y fuentes complementarias. Tras la eliminación de 151 duplicados, 388 registros fueron evaluados por título y resumen. De estos, 316 fueron excluidos por no cumplir los criterios de elegibilidad, principalmente por corresponder a revisiones, estudios en resonancia magnética, análisis de progresión sin diagnóstico inicial o investigaciones no centradas en artrosis de rodilla. Se evaluaron 72 artículos en texto completo, de los cuales 49 fueron excluidos por ausencia de métricas de precisión diagnóstica, falta de estándar de referencia, población no elegible, modalidad de imagen no pertinente o datos insuficientes. Finalmente, 23 estudios fueron incluidos en la síntesis cualitativa y 12 presentaron datos potencialmente combinables para metaanálisis.
Fig 1. Flujograma PRISMA Ver imagen al final del artículo.
Resultados
Ver tabla al final del artículo.
Tabla 3. Características principales de estudios con métricas diagnósticas reportadas.
Discusión
Los hallazgos de la presente revisión sistemática sugieren que la IA aplicada a imágenes radiográficas de rodilla constituye una herramienta diagnóstica prometedora para la evaluación de la artrosis, especialmente cuando se utilizan modelos de deep learning entrenados específicamente para la clasificación de Kellgren-Lawrence, la detección de osteofitos, la cuantificación del estrechamiento del espacio articular y la identificación de patrones estructurales sutiles. Este resultado es clínicamente relevante porque la artrosis de rodilla representa una de las principales causas de discapacidad musculoesquelética a nivel mundial y su carga epidemiológica continúa en aumento debido al envejecimiento poblacional y al incremento de factores de riesgo como obesidad, sedentarismo y lesiones articulares previas (1,2). El estudio Global Burden of Disease reportó que más de 595 millones de personas vivían con artrosis en 2020, siendo la rodilla una de las localizaciones más afectadas (4).
En concordancia con el protocolo de esta revisión, el interés principal no radicó únicamente en confirmar enfermedad establecida, sino en analizar el potencial de la IA para mejorar la detección precoz en pacientes sintomáticos, escenario donde la radiografía convencional presenta sensibilidad limitada y hallazgos frecuentemente sutiles. Desde la perspectiva fisiopatológica, este aspecto adquiere relevancia porque los cambios estructurales iniciales de la artrosis pueden preceder durante años a las alteraciones radiográficas clásicas visibles mediante evaluación convencional (7).
Los estudios incluidos evidenciaron que los modelos basados en deep learning alcanzan un rendimiento diagnóstico favorable para la clasificación automatizada de artrosis radiográfica. Pi et al. desarrollaron un modelo de ensamble basado en arquitecturas DenseNet, EfficientNet y ResNet para clasificar artrosis según Kellgren-Lawrence, demostrando que la combinación de múltiples modelos reduce la variabilidad diagnóstica y mejora la consistencia de clasificación (21). Este hallazgo es relevante porque la clasificación Kellgren-Lawrence continúa siendo el sistema radiográfico más utilizado en investigación y práctica clínica, aunque depende significativamente de la interpretación subjetiva del observador (6).
De manera similar, Yoon et al. evaluaron un software automatizado de deep learning denominado MediAI-OA para la evaluación radiográfica de artrosis de rodilla, reportando una exactitud diagnóstica global cercana al 92 %, así como una concordancia sustancial frente al estándar de referencia mediante coeficiente kappa de 0,768 (20). Estos resultados sugieren que la IA podría contribuir a estandarizar la evaluación radiográfica y disminuir la variabilidad interobservador, especialmente en centros con alta carga asistencial o menor disponibilidad de especialistas en radiología musculoesquelética.
Li et al. aportaron evidencia adicional al demostrar que el uso de radiografías multivista y conocimiento anatómico previo puede incrementar el desempeño de modelos de deep learning para clasificación de artrosis (19). Este hallazgo resulta particularmente importante desde el punto de vista imagenológico, ya que la artrosis constituye una enfermedad tridimensional y compartimental, donde la valoración mediante una sola proyección radiográfica puede subestimar cambios estructurales tempranos. En este sentido, la integración de múltiples vistas anatómicas podría permitir una representación más completa de la enfermedad y favorecer la identificación de alteraciones incipientes.
Uno de los aspectos más relevantes observados en esta revisión fue que la IA parece alcanzar mayor utilidad clínica cuando actúa como herramienta de asistencia al lector y no necesariamente como sustituto del especialista. Brejnebøl et al., en un estudio publicado en Radiology, evaluaron el efecto de la asistencia concurrente mediante IA sobre la interpretación radiográfica realizada por médicos con distintos niveles de experiencia (8). Los autores demostraron que la IA mejoró el desempeño de lectores menos experimentados e incrementó la concordancia interobservador. Este hallazgo posee alta relevancia práctica, ya que la variabilidad diagnóstica en artrosis de rodilla continúa siendo una limitación importante, especialmente en grados intermedios de Kellgren-Lawrence.
Desde una perspectiva clínica, estos resultados apoyan la visión contemporánea de la IA como herramienta de apoyo cognitivo y no como reemplazo del juicio médico. En radiología musculoesquelética, donde la experiencia del lector influye directamente en la interpretación, la posibilidad de disponer de sistemas automatizados capaces de sugerir clasificaciones, cuantificar características estructurales o señalar regiones sospechosas podría mejorar la reproducibilidad diagnóstica y optimizar el flujo de trabajo radiológico (26).
No obstante, la evidencia también mostró limitaciones relevantes. Una de las principales debilidades identificadas fue que muchos modelos presentan mejor rendimiento en estadios avanzados de artrosis que en enfermedad temprana. Song et al. demostraron que los algoritmos alcanzan altas tasas de exactitud en grados KL 3–4, mientras que el desempeño disminuye considerablemente en KL 1–2 (27). Este aspecto es crítico porque el objetivo clínico más relevante es precisamente detectar enfermedad incipiente antes de que exista daño estructural irreversible. En consecuencia, aunque la IA muestra elevada capacidad para reconocer patrones radiográficos avanzados, su utilidad real para diagnóstico precoz continúa siendo menos concluyente.
Esta limitación podría explicarse por múltiples factores. En primer lugar, los cambios estructurales iniciales suelen ser sutiles y heterogéneos, dificultando el entrenamiento de modelos robustos. En segundo lugar, muchas bases de datos utilizadas para entrenamiento contienen una distribución desbalanceada de imágenes, con predominio de casos avanzados y menor representación de grados tempranos (10). Finalmente, la clasificación Kellgren-Lawrence presenta limitaciones inherentes para evaluar enfermedad inicial, ya que depende principalmente de osteofitos y estrechamiento articular, alteraciones que pueden aparecer tardíamente (6).
Otro hallazgo importante fue la limitada validación externa de muchos algoritmos. Una proporción considerable de estudios utilizó bases públicas altamente estructuradas, como OAI o MOST, caracterizadas por imágenes bien protocolizadas y poblaciones relativamente homogéneas. Aunque estas bases resultan útiles para desarrollo inicial de modelos, pueden sobreestimar el rendimiento diagnóstico cuando los algoritmos son aplicados posteriormente en escenarios clínicos reales, donde existen variaciones en calidad de imagen, posicionamiento, protocolos radiográficos y características poblacionales (13).
En este contexto, los estudios con validación externa adquieren especial importancia. Vaattovaara et al. evaluaron modelos de deep learning en conjuntos de datos externos y compararon su rendimiento con lectores humanos expertos, reportando áreas bajo la curva ROC de hasta 0,967 en clasificación binaria de artrosis (24). Sin embargo, los autores también observaron variabilidad en sensibilidad y especificidad según el conjunto de validación, lo que refuerza la necesidad de validar estos sistemas en poblaciones diversas antes de recomendar su implementación clínica generalizada.
La heterogeneidad metodológica representó otra limitación significativa de la evidencia disponible. Los estudios incluidos difirieron en arquitectura algorítmica, tamaño muestral, estándares de referencia, esquemas de clasificación y métricas diagnósticas reportadas. Algunos trabajos utilizaron clasificación binaria, mientras otros aplicaron clasificación multiclase según Kellgren-Lawrence. Esta diferencia metodológica no es menor, ya que la clasificación binaria simplifica la tarea diagnóstica y puede incrementar artificialmente el rendimiento estadístico de los modelos (28).
Asimismo, muchos estudios reportaron métricas globales como exactitud o AUC sin proporcionar sensibilidad y especificidad por categoría diagnóstica. Esta situación limita la posibilidad de realizar metaanálisis robustos de precisión diagnóstica y dificulta la comparación entre investigaciones. Desde el punto de vista metodológico, las revisiones sistemáticas de exactitud diagnóstica requieren idealmente matrices de contingencia completas o métricas desagregadas para estimar sensibilidad, especificidad y razones de verosimilitud mediante modelos bivariados o HSROC (29).
En relación con el riesgo de sesgo, varios estudios mostraron limitaciones potenciales en selección de pacientes y validación algorítmica. La utilización de imágenes previamente filtradas, la exclusión de radiografías técnicamente complejas o el uso de conjuntos de entrenamiento y prueba parcialmente relacionados pueden introducir sobreajuste y afectar la generalización clínica de los modelos (30). La herramienta QUADAS-2 permitió identificar estos aspectos metodológicos y evaluar de manera estructurada el riesgo de sesgo en dominios críticos de estudios diagnósticos (14).
Otro aspecto emergente es la necesidad de fortalecer la transparencia metodológica en investigaciones de IA aplicada a salud. La guía STARD-AI fue desarrollada precisamente para mejorar el reporte de estudios de exactitud diagnóstica basados en inteligencia artificial, enfatizando la necesidad de describir con claridad datos de entrenamiento, validación, calibración, manejo de errores y aplicabilidad clínica (35). La implementación de estas recomendaciones resulta esencial para garantizar reproducibilidad científica y facilitar la interpretación crítica de resultados.
Desde la perspectiva de certeza de evidencia, los hallazgos de esta revisión deben interpretarse con cautela. Aunque la IA mostró resultados prometedores, la heterogeneidad metodológica, la limitada validación externa y la evidencia indirecta para diagnóstico precoz reducen la confianza global en algunas estimaciones. El enfoque GRADE para estudios diagnósticos permite precisamente valorar estas limitaciones considerando riesgo de sesgo, inconsistencia e imprecisión (4).
En términos clínicos, la principal utilidad potencial de la IA radica en tres aspectos fundamentales: mejorar la reproducibilidad diagnóstica, apoyar a lectores menos experimentados y detectar patrones estructurales sutiles que podrían pasar desapercibidos mediante evaluación convencional. Sin embargo, todavía existe evidencia limitada respecto a si estas mejoras diagnósticas se traducen efectivamente en mejores desenlaces clínicos, menor progresión estructural o reducción de procedimientos quirúrgicos como artroplastia total de rodilla.
En muchos sistemas sanitarios de ingresos medios, la radiografía convencional continúa siendo la modalidad de imagen más accesible para evaluación de artrosis de rodilla, mientras que la resonancia magnética presenta disponibilidad limitada (5). En este escenario, herramientas de IA aplicadas a radiografía podrían contribuir a mejorar equidad diagnóstica y optimizar recursos, particularmente en hospitales con escasez de especialistas en radiología musculoesquelética.
No obstante, extrapolar modelos desarrollados en poblaciones de países de altos ingresos a contextos latinoamericanos sin validación local podría introducir sesgos diagnósticos y disminuir seguridad clínica. Factores como diferencias antropométricas, prevalencia de obesidad, calidad de imagen, características epidemiológicas y variabilidad técnica pueden influir significativamente en el desempeño de los algoritmos (25). Por esta razón, resulta imprescindible desarrollar estudios multicéntricos y validaciones externas en poblaciones latinoamericanas antes de implementar ampliamente estas tecnologías.
Finalmente, los resultados negativos también aportan información relevante. Temel et al. evaluaron el rendimiento diagnóstico de IA aplicado a clasificación radiográfica de artrosis de rodilla y observaron desempeño limitado, con baja exactitud diagnóstica y AUC cercanas al azar (25). Este hallazgo demuestra que no todos los sistemas de IA poseen capacidad diagnóstica equivalente y resalta la importancia de diferenciar modelos específicamente entrenados para tareas radiológicas de modelos generales no especializados.
En conjunto, la evidencia sintetizada sugiere que la inteligencia artificial aplicada a radiografías de rodilla posee un desempeño prometedor para clasificación automatizada y apoyo diagnóstico en artrosis. Sin embargo, persisten limitaciones importantes relacionadas con diagnóstico precoz, heterogeneidad metodológica, validación externa y aplicabilidad clínica. Futuros estudios deberían priorizar diseños prospectivos, multicéntricos, con muestras consecutivas, validación externa robusta y evaluación de impacto clínico real. Solo mediante evidencia metodológicamente sólida será posible determinar si la IA puede integrarse de manera segura, equitativa y costo-efectiva en la práctica clínica cotidiana del diagnóstico por imágenes musculoesqueléticas
Conclusiones
La evidencia sintetizada en esta revisión sistemática indica que la IA aplicada a radiografía convencional de rodilla ha alcanzado un nivel de madurez suficiente para mejorar la precisión diagnóstica en la detección de artrosis, particularmente en la estandarización de la clasificación radiográfica y en la reducción de la variabilidad interobservador. Los modelos basados en deep learning, especialmente redes neuronales convolucionales y arquitecturas de ensamble, muestran un rendimiento comparable al de lectores humanos experimentados en la identificación de enfermedad estructural, consolidando su papel como herramientas de apoyo en el entorno clínico.
No obstante, este avance tecnológico contrasta con una limitación crítica: la evidencia sigue siendo menos robusta para el diagnóstico precoz de artrosis, que constituye precisamente la ventana de oportunidad clínica más relevante. La mayoría de los algoritmos presentan un rendimiento inferior en estadios iniciales (Kellgren-Lawrence 0–2), lo que sugiere que la capacidad actual de la IA está más orientada a confirmar enfermedad establecida que a detectar cambios incipientes. Esta brecha limita su impacto potencial en la prevención de progresión estructural y en la modificación temprana de la enfermedad.
Desde una perspectiva metodológica, la heterogeneidad entre estudios, la limitada validación externa, el uso predominante de bases de datos altamente seleccionadas y la inconsistencia en el reporte de métricas diagnósticas restringen la generalización de los hallazgos. En particular, la escasez de estudios en tomografía computarizada y la ausencia de análisis comparativos robustos entre modalidades de imagen impiden establecer conclusiones definitivas sobre su valor relativo frente a la radiografía convencional.
Más allá del rendimiento estadístico, el verdadero valor de la IA en imagenología musculoesquelética radica en su integración clínica. La evidencia actual sugiere que su mayor utilidad no es sustituir al radiólogo, sino potenciar su capacidad diagnóstica, especialmente en entornos con alta carga asistencial o menor disponibilidad de especialistas. En este sentido, la IA debe entenderse como una herramienta de aumento cognitivo que puede contribuir a una práctica radiológica más consistente, eficiente y potencialmente más equitativa.
Sin embargo, la adopción clínica generalizada de estas tecnologías exige superar desafíos fundamentales. Es imprescindible avanzar hacia estudios prospectivos, multicéntricos y con validación externa en poblaciones diversas, incluyendo contextos latinoamericanos, donde las diferencias en características demográficas, técnicas de adquisición de imágenes y prevalencia de enfermedad pueden afectar el rendimiento algorítmico. Asimismo, se requiere una estandarización en el reporte de estudios de IA conforme a guías como STARD-AI, así como evaluaciones rigurosas de impacto clínico, costo-efectividad y seguridad.
En conclusión, la IA representa una innovación disruptiva en el diagnóstico por imágenes de la artrosis de rodilla, con evidencia sólida en la mejora de la clasificación radiográfica y creciente potencial en el diagnóstico temprano. No obstante, su implementación clínica debe ser progresiva, crítica y basada en evidencia de alta calidad. El reto no es demostrar que la inteligencia artificial funciona en condiciones ideales, sino confirmar que mejora decisiones clínicas y resultados en salud en el mundo real.
Bibliografía
- Hunter DJ, Bierma-Zeinstra S. Osteoarthritis. Lancet. 2019;393(10182):1745-1759.
- Katz JN, Arant KR, Loeser RF. Diagnosis and Treatment of Hip and Knee Osteoarthritis: A Review. JAMA. 2021;325(6):568-578. doi: 10.1001/jama.2020.22171.
- GBD 2021 Osteoarthritis Collaborators. Global, regional, and national burden of osteoarthritis, 1990-2020 and projections to 2050: a systematic analysis for the Global Burden of Disease Study 2021. Lancet Rheumatol. 2023;5(9):e508-e522. doi: 10.1016/S2665-9913(23)00163-7. PMID: 37675071; PMCID: PMC10477960.
- De Andrade DC, Saaibi D, Sarría N, Vainstein N, Ruiz LC, Espinosa R. Assessing the burden of osteoarthritis in Latin America: a rapid evidence assessment. Clin Rheumatol. 2022;41(5):1285-1292. doi: 10.1007/s10067-022-06063-9. Epub 2022 Jan 29. PMID: 35094195; PMCID: PMC9056472.
- Guevara-Pacheco S, Feicán-Alvarado A, Sanín LH, Vintimilla-Ugalde J, Vintimilla-Moscoso F, Delgado-Pauta J, Lliguisaca-Segarra A, Dután-Erráez H, Guevara-Mosquera D, Ochoa-Robles V, Cardiel MH, Peláez-Ballestas I. Prevalence of musculoskeletal disorders and rheumatic diseases in Cuenca, Ecuador: a WHO-ILAR COPCORD study. Rheumatol Int. 2016;36(9):1195-204. doi: 10.1007/s00296-016-3446-y. Epub 2016 Mar 29. PMID: 27023004.
- Kelly ríen JH, KELLGREN LAWRENCE JS. Radiological assessment of osteo-arthrosis. Ann Rheum Dis. 1957;16(4):494-502. doi: 10.1136/ard.16.4.494. PMID: 13498604; PMCID: PMC1006995.
- Roemer FW, Guermazi A, Demehri S, Wirth W, Kijowski R. Imaging in Osteoarthritis. Osteoarthritis Cartilage. 2022;30(7):913-934. doi: 10.1016/j.joca.2021.04.018. Epub 2021 Sep 22. PMID: 34560261.
- Brejnebøl MW, Karsdal MA, Thudium CS, Boudreau RM, Turkiewicz A, Englund M, et al. Interobserver agreement and performance of concurrent artificial intelligence assistance for radiographic evaluation of knee osteoarthritis. Radiology. 2024;311(1):e233341. doi:10.1148/radiol.233341.
- Guermazi A, Roemer FW, Hayashi D. Imaging of osteoarthritis: update from a radiological perspective. Curr Opin Rheumatol. 2011;23(5):484-91. doi: 10.1097/BOR.0b013e328349c2d2. PMID: 21760511.
- Farajzadeh N, Sadeghzadeh N, Hashemzadeh M. IJES-OA Net: A residual neural network to classify knee osteoarthritis from radiographic images based on the edges of the intra-joint spaces. Med Eng Phys. 2023 Mar;113:103957. doi: 10.1016/j.medengphy.2023.103957. Epub 2023 Feb 10. PMID: 36965998.
- Teoh YX, Othmani A, Lai KW, Goh SL, Usman J. Stratifying knee osteoarthritis features through multitask deep hybrid learning: Data from the osteoarthritis initiative. Comput Methods Programs Biomed. 2023 Dec;242:107807. doi: 10.1016/j.cmpb.2023.107807. Epub 2023 Sep 20. PMID: 37778138.
- Shahid S, Wali A, Javaid A, Zikria S, Osman O, Rasheed J. Potential of AI-based diagnostic grading system for knee osteoarthritis. Front Med (Lausanne). 2025 Oct 30;12:1707588. doi: 10.3389/fmed.2025.1707588. PMID: 41244763; PMCID: PMC12611929.
- Mohammadi S, Mohammad A, Jahashahi A, Mohammad S, Seyed S, Behrouzid S, Gouarvani M, Guermazi A. Artificial intelligence in osteoarthritis detection: current evidence and limitations. Osteoarthritis Cartilage. 2024;32(4):489-500. Doi: https://doi.org/10.1016/j.joca.2023.09.011
- Sounderajah V, Guni A, Liu X, Collins GS, Karthikesalingam A, Markar SR, Golub RM, Denniston AK, Shetty S, Moher D, Bossuyt PM, Darzi A, Ashrafian H; STARD-AI Steering Committee. The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence. Nat Med. 2025 Oct;31(10):3283-3289. doi: 10.1038/s41591-025-03953-8. Epub 2025 Sep 15. PMID: 40954311.
- Jakaite L, Schetinin V, Hladůvka J, Minaev S, Ambia A, Krzanowski W. Deep learning for early detection of pathological changes in X-ray bone microstructures: case of osteoarthritis. Sci Rep. 2021 Jan 27;11(1):2294. doi: 10.1038/s41598-021-81786-4. PMID: 33504863; PMCID: PMC7840670.
- Olsson S, Akbarian E, Lind A. et al. Automating classification of osteoarthritis according to Kellgren-Lawrence in the knee using deep learning in an unfiltered adult population. BMC Musculoskelet Disord. 2021; 22 (844). DOI: https://doi.org/10.1186/s12891-021-04722-7.
- Abdullah S, Rajasekaran M, Hossen M. et al. Deep learning based classification of tibio-femoral knee osteoarthritis from lateral view knee joint X-ray images. Sci Rep. 2025; 15: 21305. DOI: https://doi.org/10.1038/s41598-025-04869-6.
- Yang J, Ji Q, Ni M, Zhang G, Wang Y. Automatic assessment of knee osteoarthritis severity in portable devices based on deep learning. J Orthop Surg Res. 2022 Dec 14;17(1):540. doi: 10.1186/s13018-022-03429-2. PMID: 36514158; PMCID: PMC974924
- Li W, Xiao Z, Liu J, Feng J, Zhu D, Liao J, Yu W, Qian B, Chen X, Fang Y, Li S. Deep learning-assisted knee osteoarthritis automatic grading on plain radiographs: the value of multiview X-ray images and prior knowledge. Quant Imaging Med Surg. 2023 Jun 1;13(6):3587-3601. doi: 10.21037/qims-22-1250. Epub 2023 Mar 30. PMID: 37284121; PMCID: PMC10239991.
- Yoon JS, Yon CJ, Lee D, Lee JJ, Kang CH, Kang SB, Lee NK, Chang CB. Assessment of a novel deep learning-based software developed for automatic feature extraction and grading of radiographic knee osteoarthritis. BMC Musculoskelet Disord. 2023 Nov 8;24(1):869. doi: 10.1186/s12891-023-06951-4. PMID: 37940935; PMCID: PMC10631128.
- Pi Y, Wang T, Xu H, Zhao Y, Liu J, Chen X. Ensemble deep learning model for knee osteoarthritis classification using radiographs. Sci Rep. 2023;13(1):20845. doi:10.1038/s41598-023-50210-4.
- Nasef NM, El-Bakry HM, Mastorakis N. Deep learning-based grading of knee osteoarthritis severity using radiographic datasets. AI. 2024;6(1):3. doi:10.3390/ai6010003.
- Lee DW, Song DS, Han HS, Ro DH. Accurate, automated classification of radiographic knee osteoarthritis severity using a novel method of deep learning: Plug-in modules. Knee Surg Relat Res. 2024 Aug 13;36(1):24. doi: 10.1186/s43019-024-00228-3. Erratum in: Knee Surg Relat Res. 2025 Apr 29;37(1):17. doi: 10.1186/s43019-025-00268-3. PMID: 39138550; PMCID: PMC11323666
- Vaattovaara E, Tiulpin A, Hirvasniemi J, Saarakkala S, Turkiewicz A, Englund M. External validation of deep learning models for knee osteoarthritis diagnosis and comparison with human readers. Osteoarthritis Cartilage. 2025;33(2):245-256. doi:10.1016/j.joca.2024.11.006.
- Temel S, Kayaalp ME, Yilmaz M, Arslan G, Demir H. Diagnostic performance of ChatGPT in knee osteoarthritis grading on radiographs: a comparative study. Comput Biol Med. 2025;172:108332. doi:10.1016/j.compbiomed.2025.108332.
- Topol EJ. High-performance medicine: the convergence of human and artificial intelligence. Nat Med. 2019;25(1):44-56. doi:10.1038/s41591-018-0300-7.
- Song JH, Lee HJ, Kim DH, Park YS. Automated classification of knee osteoarthritis severity using deep learning plug-in modules. Egypt J Radiol Nucl Med. 2025;56(1):68. doi:10.1186/s43055-025-01234-5.
- Abdullah AA, Rajasekaran S. Deep learning techniques for knee osteoarthritis detection and classification: a radiographic study. J Med Syst. 2022;46(8):55. doi:10.1007/s10916-022-01845-2.
- McInnes MDF, Moher D, Thombs BD, McGrath TA, Bossuyt PM, Clifford T, et al. Preferred Reporting Items for a Systematic Review and Meta-analysis of Diagnostic Test Accuracy Studies: The PRISMA-DTA Statement. JAMA. 2018;319(4):388-96. doi:10.1001/jama.2017.19163.
- Whiting PF, Rutjes AWS, Westwood ME, Mallett S, Deeks JJ, Reitsma JB, et al. QUADAS-2: a revised tool for quality assessment of diagnostic accuracy studies. Ann Intern Med. 2011;155(8):529-36. doi:10.7326/0003-4819-155-8-201110180-00009.
- Yang B, Mallett S, Takwoingi Y, Davenport C, Hyde C, Whiting P, et al. GRADE guidance: assessing the certainty across a body of evidence for comparative test accuracy. J Clin Epidemiol. 2021;136:146-56.
Abreviaturas:
IA: Inteligencia artificial.
DL: Deep learning.
ML: Machine learning.
CNN: Convolutional Neural Network.
TC: Tomografía computarizada.
ROC: Receiver Operating Characteristic.
AUC: Área bajo la curva.
PRISMA-DTA: Preferred Reporting Items for Systematic Reviews and Meta-Analyses of Diagnostic Test Accuracy Studies.
QUADAS-2: Quality Assessment of Diagnostic Accuracy Studies-2.
GRADE: Grading of Recommendations Assessment, Development and Evaluation.
OAI: Osteoarthritis Initiative.
MOST: Multicenter Osteoarthritis Study.
KL: Kellgren-Lawrence.
JSN: Joint Space Narrowing.
HSROC: Hierarchical Summary Receiver Operating Characteristic.
OARSI: Osteoarthritis Research Society International.
CT: Computed Tomography.
AP: Anteroposterior.
ResNet: Residual Neural Network.
DenseNet: Densely Connected Convolutional Network.
VGG: Visual Geometry Group Network.
U-Net: U-shaped Convolutional Network.
Grad-CAM: Gradient-weighted Class Activation Mapping.
IEEE: Institute of Electrical and Electronics Engineers.
MeSH: Medical Subject Headings.
PICO: Population, Intervention, Comparison, Outcome.
ACR: American College of Radiology.
Consideraciones éticas:
La presente investigación corresponde a una revisión sistemática basada en estudios previamente publicados, por lo que no involucró intervención directa en seres humanos ni acceso a datos personales identificables. En consecuencia, no requirió aprobación de un comité de ética. El estudio se desarrolló siguiendo recomendaciones PRISMA-DTA y principios de integridad científica.
Financiamiento:
La investigación no recibió financiamiento de instituciones públicas, privadas o comerciales. Todos los gastos fueron asumidos por los Autores.
Conflicto de intereses:
Los Autores declaran no presentar conflictos de intereses relacionados con esta investigación.
Registro del protocolo:
El protocolo de esta revisión sistemática fue registrado previamente en PROSPERO: CRD420261345323.



