metricas

Educación Médica

Sugerencias
Educación Médica Evaluación comparativa de modelos de inteligencia artificial de última generac...
Información de la revista
Vol. 27. Núm. 3.
(Mayo - Junio 2026)
Cita
Cita
Compartir
Descargar PDF
Más opciones de artículo
Visitas
444
Vol. 27. Núm. 3.
(Mayo - Junio 2026)
Original
Acceso a texto completo

Evaluación comparativa de modelos de inteligencia artificial de última generación frente a psiquiatras humanos en el examen nacional de subespecialidad en Perú: un estudio transversal

Benchmarking state-of-the-art artificial intelligence models against human psychiatrists on the national subspecialty examination in Peru: A cross-sectional study
Visitas
444
Javier A. Flores-Cohailaa,b, Jeff Huarcaya-Victoriac,d, Cesar Copaja-Corzoe,
Autor para correspondencia
csarcopaja@gmail.com

Autor para correspondencia.
a Grupo Neurociencias, Metabolismo, Efectividad Clínica y Sanitaria (NEMECS), Carrera de Medicina Humana, Universidad Científica del Sur, Lima, Perú
b Servicio de Psiquiatría, Hospital Víctor Larco Herrera, Magdalena, Lima, Perú
c Escuela Profesional de Medicina Humana, Universidad Privada San Juan Bautista, Filial Ica, Perú
d Dirección Médica, Yachay - Centro de Excelencia en Salud Mental, Lima, Perú
e Unidad de Investigación para la Generación y Síntesis de Evidencias en Salud, Universidad San Ignacio de Loyola, Lima, Perú
Este artículo ha recibido
Información del artículo
Resumen
Texto completo
Bibliografía
Descargar PDF
Estadísticas
Figuras (1)
f0005
Tablas (1)
Tabla 1. Precisión comparativa y concordancia interobservadores de 4 modelos de inteligencia artificial en el Examen de Subespecialidad de Psiquiatría de Perú (2022–2025)
Tablas
Resumen
Introducción

Evaluar el rendimiento de 4 modelos de inteligencia artificial (IA) de última generación (GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash, DeepSeek V3) en las evaluaciones de subespecialidad de psiquiatría, un área aún inexplorada.

Material y métodos

Se compararon los modelos de IA contra el Examen Nacional de Subespecialidad de Psiquiatría de Perú (2022–2025; n = 400 preguntas) mediante la estrategia zero-shot prompting. El grupo de comparación consistió en 42 psiquiatras licenciados.

Resultados

Todos los modelos superaron el 90% de precisión (rango: 91,0%–94,2%), sin diferencias estadísticamente significativas (p = 0,32). Los modelos de IA superan consistentemente a los psiquiatras, con brechas medias entre 10,8 y 20,8 puntos porcentuales. Las preguntas de diagnóstico obtuvieron la mayor precisión (95,9%), mientras que los ítems de tratamiento mostraron un rendimiento inferior (88,2%–91,2%). El 83% (10 de 12) de los fallos concurrentes se atribuyeron a problemas en los ítems: 6 por diseño defectuoso o ambiguo, y 4 por conflictos con el consenso médico actual.

Conclusión

El rendimiento de la IA iguala o supera al de los psiquiatras en evaluaciones de opción múltiple de conocimiento psiquiátrico. Estos hallazgos sugieren la necesidad de reorientar la evaluación en educación médica hacia competencias de juicio clínico y razonamiento terapéutico.

Palabras clave:
Inteligencia artificial
Medición educativa
Internado y residencia
Perú
Psiquiatría
Abstract
Introduction

To evaluate the performance of four state-of-the-art AI models (GPT-5, Claude 4.5 Sonnet, Gemini 2.5-Flash, DeepSeek V3) on psychiatry subspecialty assessments, an area that remains relatively unexplored.

Materials and methods

The AI models were benchmarked against Peru's National Psychiatry Subspecialty Examination (2022–2025, n = 400 questions) using a zero-shot prompting strategy. The comparison group consisted of 42 licensed psychiatrists.

Results

All models exceeded 90% accuracy (range: 91.0%–94.2%), with no statistically significant differences between them (p = 0.32). AI models consistently outperformed human psychiatrists, with mean accuracy gaps ranging from 10.8 to 20.8 percentage points. Diagnostic questions yielded the highest accuracy (95.9%), while treatment items showed lower performance (88.2%–91.2%). Among the 12 concurrent model failures, 83% (10/12) were attributed to item construction issues: six to defective or ambiguous design, and four to conflicts with current medical consensus.

Conclusion

AI performance matches or exceeds that of psychiatrists on knowledge-based multiple-choice assessments. These findings suggest that medical education assessments should be reoriented toward clinical judgment and therapeutic reasoning competencies.

Keywords:
Artificial intelligence
Educational measurement
Internship & residency
Peru
Psychiatry
Texto completo
Introducción

Los modelos de inteligencia artificial (IA) han alcanzado tasas de precisión superiores al 90% en los exámenes de licencia médica a nivel mundial1,2. Este rendimiento sugiere un dominio sustancial del conocimiento médico general evaluado mediante opción múltiple. En consecuencia, la frontera de investigación se ha desplazado hacia los exámenes de subespecialidades.

Si bien los modelos de IA muestran dominio en subespecialidades estructuradas como cirugía o urología3, su aplicación en psiquiatría permanece inexplorada. Los estudios iniciales indican que la IA se desempeña adecuadamente en exámenes de certificación psiquiátrica, aunque su precisión suele ser inferior a la obtenida en medicina general4–6. Además, la literatura existente presenta 3 limitaciones: el uso de arquitecturas de modelos más antiguos, la falta de comparabilidad directa entre modelos de última generación y la escasez de datos de regiones en desarrollo.

Este estudio compara el rendimiento de 4 modelos de IA de última generación (GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash y DeepSeek V3) en el Examen Nacional de Subespecialidad de Psiquiatría de Perú (2022–2025).

Material y métodosDiseño y contexto

Se realizó un estudio transversal comparando el rendimiento de modelos de IA en un examen médico de alto riesgo. El manuscrito sigue las pautas STROBE para investigación observacional7.

El examen evaluado fue el Examen Nacional de Subespecialidad de Psiquiatría de Perú, organizado anualmente por CONAREME. Consta de 100 preguntas de opción múltiple y evalúa 2 subespecialidades con el mismo instrumento: psiquiatría del niño y del adolescente, y psiquiatría de las adicciones.

Unidad de análisis

Se evaluaron 4 modelos de IA seleccionados por su rendimiento en evaluaciones internacionales y disponibilidad vía API: GPT-5 (OpenAI), Claude 4.5 Sonnet (Anthropic), Gemini 2.5-Flash (Google) y DeepSeek V3 (DeepSeek). El grupo de comparación consistió en 42 psiquiatras licenciados que rindieron el examen entre 2022 y 2025.

El conjunto de datos incluyó las 400 preguntas administradas entre 2022 y 2025 (n = 100 por año). La edición de 2022 utilizó 5 opciones (A-E); las de 2023–2025, 4 opciones (A-D). CONAREME no ha publicado informes técnicos ni evidencia de validez psicométrica para este instrumento. Todos los exámenes están disponibles en https://www.conareme.org.pe/web/.

Variable

La variable de resultado primaria fue la precisión, definida como el porcentaje de respuestas correctas por modelo en relación con la clave oficial. Para los psiquiatras, se utilizó la puntuación bruta agregada; las puntuaciones a nivel de ítems individuales no estaban disponibles. La variable secundaria fue la concordancia intermodelo.

Las variables independientes fueron: año del examen (2022–2025), competencia (diagnóstico, tratamiento, conocimiento general), tipo de pregunta (basada en hechos frente a basada en casos) y tema de subespecialidad. Las categorías temáticas (neurociencia, psicopatología general, psiquiatría del adulto, psiquiatría del niño y del adolescente, psiquiatría de enlace, adicciones y psicoterapia) fueron codificadas siguiendo el programa de estudios del RANZCP.

Procedimientos

Se empleó una estrategia de zero-shot prompting. Cada modelo fue instruido a actuar como «psiquiatra experto y profesor universitario», generando respuestas en formato JSON con justificación y clave seleccionada. No se proporcionaron ejemplos (few-shot) ni herramientas externas (Chain-of-Thought), con el fin de evaluar el conocimiento intrínseco de los modelos. Para minimizar el sesgo de selección, se incluyó el universo completo de preguntas.

Análisis de datos

La precisión se comparó entre modelos mediante la prueba de chi-cuadrado, y la concordancia inter-modelo se evaluó mediante la Kappa de Fleiss. La precisión se expresó como porcentaje con intervalos de confianza (IC) del 95%. Un valor de p < 0,05 se consideró estadísticamente significativo. Todos los análisis se realizaron en R versión 4.1,2 (R Foundation for Statistical Computing). Para los 12 ítems donde todos los modelos fallaron concurrentemente, se realizó un análisis cualitativo de contenido para identificar patrones de similitud en los fallos.

Resultados

Como se muestra en la tabla 1, todos los modelos superaron el 90% de precisión general, sin diferencias estadísticamente significativas (p = 0,32). La concordancia intermodelo fue moderada (kappa = 0,59). Gemini 2.5 obtuvo la precisión más alta (94,2%), seguido de Claude 4.5 (91,8%), GPT-5 (91,5%) y DeepSeek V3 (91,0%). El análisis temporal mostró precisión alta en todas las cohortes. El examen de 2024 presentó la mayor concordancia (kappa = 0,69), y el de 2023 la mayor precisión de un solo modelo (96,0%, Gemini 2.5).

Tabla 1.

Precisión comparativa y concordancia interobservadores de 4 modelos de inteligencia artificial en el Examen de Subespecialidad de Psiquiatría de Perú (2022–2025)

  Gemini 2.5n (%)  DeepSeek V3n (%)  GPT-5n (%)  Claude 4.5n (%)  pa  Tasa de acuerdo %  Kappa de Fleiss 
General  377/400 (94,2)  364/400 (91)  366/400 (91,5)  367/400 (91,8)  0,3233  89  0,5922 
Año               
2022 (n = 100)  92/100 (92)  88/100 (88)  90/100 (90)  90/100 (90)  0,8281  88  0,6481 
2023 (n = 100)  96/100 (96)  89/100 (89)  89/100 (89)  91/100 (91)  0,2507  85  0,4677 
2024 (n = 100)  94/100 (94)  92/100 (92)  94/100 (94)  91/100 (91)  0,8003  92  0,6902 
2025 (n = 100)  95/100 (95)  95/100 (95)  93/100 (93)  95/100 (95)  0,9016  91  0,5511 
Competencia               
Diagnóstico (n = 221)  212/221 (95,9)  204/221 (92,3)  203/221 (91,9)  210/221 (95)  0,2073  90  0,5541 
Tratamiento (n = 102)  92/102 (90,2)  91/102 (89,2)  93/102 (91,2)  90/102 (88,2)  0,9121  89,20  0,6815 
Conocimiento General (n = 77)  73/77 (94,8)  69/77 (89,6)  70/77 (90,9)  67/77 (87)  0,4145  85,70  0,5305 
Tipo de pregunta               
Basada en hechos (n = 217)  206/217 (94,9)  197/217 (90,8)  194/217 (89,4)  192/217 (88,5)  0,094  87,10  0,5869 
Basada en casos (n = 183)  171/183 (93,4)  167/183 (91,3)  172/183 (94)  175/183 (95,6)  0,395  91,30  0,5983 
Tema               
Adicciones (n = 33)  32/33 (97)  27/33 (81,8)  28/33 (84,8)  29/33 (87,9)  0,2633  75,80  0,3836 
Psiquiatría general (n = 125)  116/125 (92,8)  116/125 (92,8)  114/125 (91,2)  116/125 (92,8)  0,952  93,60  0,7532 
Psiquiatría de niños y adolescentes (n = 49)  45/49 (91,8)  45/49 (91,8)  46/49 (93,9)  46/49 (93,9)  0,9586  93,90  0,7436 
Psicopatología general (n = 74)  71/74 (95,9)  68/74 (91,9)  67/74 (90,5)  68/74 (91,9)  0,622  86,50  0,4762 
Psiquiatría de enlace (n = 67)  62/67 (92,5)  61/67 (91)  62/67 (92,5)  62/67 (92,5)  0,9845  89,60  0,6039 
Neurociencias (n = 29)  29/29 (100)  27/29 (93,1)  28/29 (96,6)  27/29 (93,1)  0,5127  86,20  0,0943 
Psicoterapia (n = 23)  22/23 (95,7)  20/23 (87)  21/23 (91,3)  19/23 (82,6)  0,5234  82,60  0,5512 
a

p fue calculado para la prueba de chi-cuadrado. Las preguntas de psicofarmacología fueron categorizadas bajo la neurociencia y temas específicos debido a gran solapamiento.

El rendimiento de la IA mostró una tendencia ascendente constante, mientras que el de los psiquiatras fue variable (fig. 1). Las puntuaciones medias de la IA aumentaron de 90,0% (IC 95%: 87,1–92,9%) en 2022 a 94,5% (IC 95%: 92,3–96,7%) en 2025. Los psiquiatras iniciaron en 78,5% (IC 95%: 72,3–84,7%) en 2022, descendieron a 75,3% en 2023 y alcanzaron 84,2% (IC 95%: 81,6–86,8%) en 2025. La brecha de rendimiento entre la IA y los psiquiatras varió por año: 13,5 puntos porcentuales en 2022, 20,8 en 2023, 12,5 en 2024 y 10,8 en 2025.

Figura 1.

Tendencias temporales en el Examen de Subespecialidad de Psiquiatría de Perú, comparación entre modelos de IA y psiquiatras con brechas de rendimiento, 2022 a 2025.

Los modelos fallaron concurrentemente en 12 ítems (material complementario). Dos fallos se debieron a una mala interpretación por parte de la IA. Los 10 restantes se atribuyen a problemas de construcción: 6 involucraron diseño defectuoso o ambiguo (dobles respuestas correctas, viñetas clínicas vagas o errores de redacción). Los 4 restantes presentaban conflictos entre la clave oficial y el consenso médico actual, en temas como dependencia de zolpidem, manejo del TDAH en preescolares y marcos de tiempo diagnósticos.

DiscusiónResumen de resultados

Los 4 modelos evaluados alcanzaron precisiones superiores al 90%, sin superioridad estadística entre ellos (p = 0,32, k= 0,59). Todos superaron a los psiquiatras postulantes por 10,8 a 20,8 puntos porcentuales. En los 12 fallos concurrentes, la mayoría (10/12) se atribuyeron a problemas de los ítems, no a limitaciones de los modelos.

Interpretación de resultados

El rendimiento superior en diagnóstico frente a tratamiento podría reflejar diferencias en la naturaleza cognitiva de ambas tareas. El razonamiento diagnóstico opera como categorización basado en reconocimiento de patrones, una función para la que los modelos de IA parecen estar bien adaptados. Por el contrario, la formulación del tratamiento requiere integrar contraindicaciones, determinantes sociales y guías locales, donde los modelos mostraron debilidad relativa8.

La ausencia de un modelo superior y la concordancia moderada sugieren un posible efecto de techo para preguntas de opción múltiple. Dada esta paridad, la selección de modelos podría priorizar la rentabilidad. DeepSeek V3, por ejemplo, alcanzó un rendimiento equivalente a los demás modelos a un costo de 0,20 USD para las 400 preguntas.

Comparación con estudios previos

Estos resultados son consistentes con evaluaciones recientes que confirman puntuaciones cercanas al máximo en modelos de última generación. Sin embargo, contrastan con investigaciones previas donde GPT-4o y versiones anteriores alcanzaron 78 y 81% en exámenes de psiquiatría infantil5,6. La mayor precisión en nuestro estudio (>90%) podría estar relacionada con el uso de modelos más recientes, como GPT-5 y Gemini 2.5. No obstante, esta comparación entre estudios no permite establecer una relación directa.

Limitaciones

Este estudio presenta fortalezas relevantes: 400 ítems durante 4 años consecutivos, evaluación simultánea de 4 modelos de última generación y el uso de una estrategia de prompting estandarizada que favorece la replicabilidad.

No obstante, la estrategia de zero-shot prompting puede subestimar la capacidad de los modelos frente a técnicas como few-shot o Chain-of-Thought, lo que constituye un sesgo conservador. Adicionalmente, la clave de respuesta oficial, tanto como el examen carece de validación psicométrica pública, lo que introduce un posible sesgo de medición.

La comparación con psiquiatras se basó en datos agregados, dado que las puntuaciones individuales por ítem no estaban disponibles. Aunque esto no afecta la comparación global, impide análisis por competencia, tipo de pregunta o subespecialidad. Los modelos, además, no experimentan estrés ni limitaciones de tiempo, lo que limita la validez ecológica de la comparación.

Generalizabilidad

Estos resultados son aplicables a exámenes de psiquiatría en Latinoamérica, anclados en el DSM-5/CIE-11, circunscritos a los niveles de «saber» y «saber cómo» de la pirámide de Miller. La reproducibilidad en otros contextos requiere cautela: marcos curriculares y formatos de evaluación varían entre países. Exámenes con preguntas de respuesta extendida o evaluaciones clínicas estructuradas podrían arrojar resultados diferentes.

Implicancias

El bajo costo y la alta precisión (>90%) de los modelos evaluados respaldan su potencial como herramientas de tutoría, particularmente en entornos con recursos limitados. Además, el hallazgo de que el 83% de los fallos concurrentes correspondieron a problemas de construcción de ítems sugiere, además, su utilidad para auditar y mejorar la calidad de las preguntas de examen. La investigación futura debería evaluar la validez ecológica de estas herramientas dentro de flujos de trabajo clínicos reales.

En conclusión, todos los modelos de IA evaluados alcanzaron una precisión superior al 90%, superando consistentemente a los psiquiatras postulantes. En el dominio de la evocación de hechos evaluada mediante opción múltiple, el rendimiento de la IA igualó o excedió al de los especialistas humanos. Estos hallazgos respaldan la utilidad de la IA como herramienta de bajo costo para la autoevaluación educativa y la auditoría de calidad de preguntas de examen. Asimismo, sugieren que las evaluaciones en educación médica podrían evolucionar hacia la medición de competencias de juicio clínico y razonamiento terapéutico, dimensiones que no fueron evaluadas en el presente estudio.

Responsabilidades éticas

La revisión y aprobación por parte de un comité de ética fue eximida para el presente estudio, dado que se basó exclusivamente en el análisis de una base de datos secundaria, de acceso público y completamente anonimizada. La información utilizada no contenía identificadores personales directos o indirectos que permitieran vincular los datos a individuos específicos.

Financiación

La Universidad San Ignacio de Loyola financió el cargo de procesamiento del artículo (APC) (Código: USIL-2025). La obtención de fondos estuvo a cargo del autor C.C.C. El financiador no participó en el diseño del estudio, la recopilación y el análisis de datos, la decisión de publicación ni la preparación del manuscrito.

Conflicto de intereses

Los autores declaran que no tienen conflictos de intereses.

Declaración de uso de inteligencia artificial

Sí, evaluamos el rendimiento de 4 modelos largos de lenguaje: GPT-5 (OpenAI), Claude 4.5 Sonnet (Anthropic), Gemini 2.5-Flash (Google) y DeepSeek V3 (DeepSeek).

Contribuciones

Javier A. Flores-Cohaila: Trabajó en la conceptualización, metodología, redacción, borrador original, redacción, revisión y edición, aprobación de la versión final. Jeff Huarcaya-Victoria: Trabajó en la metodología, redacción, borrador original y aprobación de la versión final. César Copaja-Corzo: Trabajó en la supervisión, revisión crítica del contenido intelectual, financiamiento, redacción, revisión y edición.

Disponibilidad de datos y materiales

Los datos anónimos están disponibles públicamente en el portal de CONAREME: https://www.conareme.org.pe/web/.

Bibliografía
[1]
H. Nouri, A. Mahdavi, A. Abedi, A. Mohammadnia, M. Hamedan, M. Amanzadeh.
Performance of large language models in medical licensing examinations: a systematic review and meta-analysis.
J Educ Eval Health Prof, 22 (2025), pp. 36
[2]
A. Kasagga, A. Sapkota, G. Changaramkumarath, J.M. Abucha, M.M. Wollel, N. Somannagari, et al.
Performance of ChatGPT and large language models on medical licensing exams worldwide: a systematic review and network meta-analysis with meta-regression.
[3]
S. Qin, B. Chislett, J. Ischia, W. Ranasinghe, D. de Silva, J. Coles-Black, et al.
ChatGPT and generative AI in urology and surgery—a narrative review.
BJUI Compass, 5 (2024), pp. 927-935
[4]
Ünal I. Özönder.
Evaluating AI in psychiatry board exams: a comparative study of ChatGPT-4 and Google Gemini.
Haydarpasa Numune Med J, 64 (2024), pp. 165-173
[5]
A. Kowalczyk, M. Loson-Kawalec, A. Tabor, P. Dadynska, K. Romanowicz, A. Wielochowska, et al.
Comparison of GPT-4 responses with the official results of the Polish specialized psychiatric examination in child and adolescent psychiatry.
[6]
J.C. Neubauer, A. Kaiser, L. Lettermann, T. Volkert, A. Häge.
Performance of large language models ChatGPT and Gemini in child and adolescent psychiatry knowledge assessment.
[7]
E. von Elm, D.G. Altman, M. Egger, S.J. Pocock, P.C. Gøtzsche, J.P. Vandenbroucke.
Strengthening the reporting of observational studies in epidemiology (STROBE) statement: guidelines for reporting observational studies.
[8]
D.A. Cook, J. Sherbino, S.J. Durning.
Management reasoning: beyond the diagnosis.
JAMA, 319 (2018), pp. 2267-2268
Copyright © 2026. The Authors
Descargar PDF
asdasdasd
Opciones de artículo
Herramientas