metricas
Revista Española de Geriatría y Gerontología ¿Aprobaría la inteligencia artificial un examen de Geriatría?: evaluación de...
Información de la revista
Vol. 61. Núm. 5. (En progreso)
(Septiembre - Octubre 2026)
Cita
Cita
Compartir
Descargar PDF
Más opciones de artículo
Visitas
207
Vol. 61. Núm. 5. (En progreso)
(Septiembre - Octubre 2026)
Original breve

¿Aprobaría la inteligencia artificial un examen de Geriatría?: evaluación de respuestas conversacionales y su precisión

Would artificial intelligence pass a Geriatrics exam?: evaluating conversational responses and their accuracy
Visitas
207
Yanira Aranda Rubioa,b,
Autor para correspondencia
Yanira.aranda@salud.madrid.org

Autor para correspondencia.
, Natalia Loren Lázaroa, Fernando Canillas del Reyb,c
a Servicio de Geriatría, Hospital Universitario Central de la Cruz Roja San José y Santa Adela, Madrid, España
b Universidad Alfonso X el Sabio, Madrid, España
c Servicio de Traumatología, Hospital Universitario Central de la Cruz Roja San José y Santa Adela, Madrid, España
Este artículo ha recibido
Información del artículo
Resumen
Texto completo
Bibliografía
Descargar PDF
Estadísticas
Resumen
Objetivos

Evaluar la precisión de seis modelos diferentes de inteligencia artificial (IA) al responder preguntas del examen MIR (Médico Interno Residente) de España relacionadas con la Geriatría.

Métodos

Se analizó el rendimiento de seis modelos de IA comparando sus respuestas conversacionales con las soluciones oficiales del examen MIR. La exactitud de cada modelo se midió en función del número de respuestas correctas obtenidas en las preguntas de Geriatría. Se realizó un análisis descriptivo de los porcentajes de acierto debido al tamaño de la muestra. Las preguntas se agruparon en categorías temáticas específicas y se analizó la complejidad lingüística de las respuestas justificadas mediante el uso formal del índice INFLESZ.

Resultados

Los modelos demostraron un alto índice de aciertos: el rendimiento máximo se situó en el 97,22%, un grupo intermedio alcanzó el 91,67%, y la puntuación mínima fue del 83,33%. Únicamente una pregunta clínica (paciente de 90años con insomnio por gonalgia secundaria a gonartrosis) fue fallada de forma simultánea por cinco de las seis herramientas analizadas. El índice INFLESZ global osciló entre 44,63 y 49,26, catalogando los textos explicativos como «algo difícil».

Conclusiones

Los modelos de IA constituyen herramientas de notable fiabilidad y utilidad potencial para el entorno de la formación médica teórica debido a sus elevadas tasas de respuestas correctas. No obstante, presentan limitaciones evidentes en la práctica clínica real debido a la variabilidad de los escenarios médicos individuales, no siempre reproducibles mediante un diseño algorítmico tradicional. Por ello, su rol en la medicina actual debe concebirse de manera complementaria y nunca como un sistema autónomo en el diagnóstico o la toma de decisiones asistenciales.

Palabras clave:
Personas mayores
Inteligencia artificial
Geriatría
Abstract
Objective

To evaluate the accuracy of six different artificial intelligence (AI) models in answering questions from Spain's MIR (Médico Interno Residente) exam related to Geriatrics.

Methods

The performance of six AI models was analyzed by comparing their conversational responses with the official answer keys of the MIR exam. The accuracy of each model was measured based on the number of correct answers obtained for the Geriatrics questions. Due to the sample size, a descriptive analysis of the accuracy percentages was performed. The questions were grouped into specific thematic categories, and the linguistic complexity of the justified responses was analyzed using the formal application of the INFLESZ readability index.

Results

The models demonstrated a high accuracy rate: peak performance reached 97.22%, an intermediate group achieved 91.67%, and the minimum score was 83.33%. Only one clinical question (a 90-year-old patient with insomnia due to gonalgia secondary to gonarthrosis) was failed simultaneously by five of the six analyzed tools. The overall INFLESZ index ranged between 44.63 and 49.26, classifying the explanatory texts as «somewhat difficult».

Conclusions

AI models constitute tools of remarkable reliability and potential utility for theoretical medical education environments due to their high correct answer rates. However, they exhibit evident limitations in real-world clinical practice owing to the variability of individual medical scenarios, which are not always reproducible through traditional algorithmic design. Therefore, their role in current medicine must be conceived as complementary and never as an autonomous system for diagnosis or healthcare decision-making.

Keywords:
Older adults
Artificial intelligence
Geriatrics

Artículo

Opciones para acceder a los textos completos de la publicación Revista Española de Geriatría y Gerontología
Suscriptor
Suscriptor de la revista

Si ya tiene sus datos de acceso, clique aquí.

Si olvidó su clave de acceso puede recuperarla clicando aquí y seleccionando la opción "He olvidado mi contraseña".
Comprar
Comprar acceso al artículo

Comprando el artículo el PDF del mismo podrá ser descargado

Comprar ahora
Contactar
Teléfono para suscripciones e incidencias
De lunes a viernes de 9h a 18h (GMT+1) excepto los meses de julio y agosto que será de 9 a 15h
Llamadas desde España
932 415 960
Llamadas desde fuera de España
+34 932 415 960
E-mail
asdasdasd
Opciones de artículo
Herramientas