Evaluar la precisión de seis modelos diferentes de inteligencia artificial (IA) al responder preguntas del examen MIR (Médico Interno Residente) de España relacionadas con la Geriatría.
MétodosSe analizó el rendimiento de seis modelos de IA comparando sus respuestas conversacionales con las soluciones oficiales del examen MIR. La exactitud de cada modelo se midió en función del número de respuestas correctas obtenidas en las preguntas de Geriatría. Se realizó un análisis descriptivo de los porcentajes de acierto debido al tamaño de la muestra. Las preguntas se agruparon en categorías temáticas específicas y se analizó la complejidad lingüística de las respuestas justificadas mediante el uso formal del índice INFLESZ.
ResultadosLos modelos demostraron un alto índice de aciertos: el rendimiento máximo se situó en el 97,22%, un grupo intermedio alcanzó el 91,67%, y la puntuación mínima fue del 83,33%. Únicamente una pregunta clínica (paciente de 90años con insomnio por gonalgia secundaria a gonartrosis) fue fallada de forma simultánea por cinco de las seis herramientas analizadas. El índice INFLESZ global osciló entre 44,63 y 49,26, catalogando los textos explicativos como «algo difícil».
ConclusionesLos modelos de IA constituyen herramientas de notable fiabilidad y utilidad potencial para el entorno de la formación médica teórica debido a sus elevadas tasas de respuestas correctas. No obstante, presentan limitaciones evidentes en la práctica clínica real debido a la variabilidad de los escenarios médicos individuales, no siempre reproducibles mediante un diseño algorítmico tradicional. Por ello, su rol en la medicina actual debe concebirse de manera complementaria y nunca como un sistema autónomo en el diagnóstico o la toma de decisiones asistenciales.
To evaluate the accuracy of six different artificial intelligence (AI) models in answering questions from Spain's MIR (Médico Interno Residente) exam related to Geriatrics.
MethodsThe performance of six AI models was analyzed by comparing their conversational responses with the official answer keys of the MIR exam. The accuracy of each model was measured based on the number of correct answers obtained for the Geriatrics questions. Due to the sample size, a descriptive analysis of the accuracy percentages was performed. The questions were grouped into specific thematic categories, and the linguistic complexity of the justified responses was analyzed using the formal application of the INFLESZ readability index.
ResultsThe models demonstrated a high accuracy rate: peak performance reached 97.22%, an intermediate group achieved 91.67%, and the minimum score was 83.33%. Only one clinical question (a 90-year-old patient with insomnia due to gonalgia secondary to gonarthrosis) was failed simultaneously by five of the six analyzed tools. The overall INFLESZ index ranged between 44.63 and 49.26, classifying the explanatory texts as «somewhat difficult».
ConclusionsAI models constitute tools of remarkable reliability and potential utility for theoretical medical education environments due to their high correct answer rates. However, they exhibit evident limitations in real-world clinical practice owing to the variability of individual medical scenarios, which are not always reproducible through traditional algorithmic design. Therefore, their role in current medicine must be conceived as complementary and never as an autonomous system for diagnosis or healthcare decision-making.
