Evaluar el rendimiento de 4 modelos de inteligencia artificial (IA) de última generación (GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash, DeepSeek V3) en las evaluaciones de subespecialidad de psiquiatría, un área aún inexplorada.
Material y métodosSe compararon los modelos de IA contra el Examen Nacional de Subespecialidad de Psiquiatría de Perú (2022–2025; n = 400 preguntas) mediante la estrategia zero-shot prompting. El grupo de comparación consistió en 42 psiquiatras licenciados.
ResultadosTodos los modelos superaron el 90% de precisión (rango: 91,0%–94,2%), sin diferencias estadísticamente significativas (p = 0,32). Los modelos de IA superan consistentemente a los psiquiatras, con brechas medias entre 10,8 y 20,8 puntos porcentuales. Las preguntas de diagnóstico obtuvieron la mayor precisión (95,9%), mientras que los ítems de tratamiento mostraron un rendimiento inferior (88,2%–91,2%). El 83% (10 de 12) de los fallos concurrentes se atribuyeron a problemas en los ítems: 6 por diseño defectuoso o ambiguo, y 4 por conflictos con el consenso médico actual.
ConclusiónEl rendimiento de la IA iguala o supera al de los psiquiatras en evaluaciones de opción múltiple de conocimiento psiquiátrico. Estos hallazgos sugieren la necesidad de reorientar la evaluación en educación médica hacia competencias de juicio clínico y razonamiento terapéutico.
To evaluate the performance of four state-of-the-art AI models (GPT-5, Claude 4.5 Sonnet, Gemini 2.5-Flash, DeepSeek V3) on psychiatry subspecialty assessments, an area that remains relatively unexplored.
Materials and methodsThe AI models were benchmarked against Peru's National Psychiatry Subspecialty Examination (2022–2025, n = 400 questions) using a zero-shot prompting strategy. The comparison group consisted of 42 licensed psychiatrists.
ResultsAll models exceeded 90% accuracy (range: 91.0%–94.2%), with no statistically significant differences between them (p = 0.32). AI models consistently outperformed human psychiatrists, with mean accuracy gaps ranging from 10.8 to 20.8 percentage points. Diagnostic questions yielded the highest accuracy (95.9%), while treatment items showed lower performance (88.2%–91.2%). Among the 12 concurrent model failures, 83% (10/12) were attributed to item construction issues: six to defective or ambiguous design, and four to conflicts with current medical consensus.
ConclusionAI performance matches or exceeds that of psychiatrists on knowledge-based multiple-choice assessments. These findings suggest that medical education assessments should be reoriented toward clinical judgment and therapeutic reasoning competencies.
Los modelos de inteligencia artificial (IA) han alcanzado tasas de precisión superiores al 90% en los exámenes de licencia médica a nivel mundial1,2. Este rendimiento sugiere un dominio sustancial del conocimiento médico general evaluado mediante opción múltiple. En consecuencia, la frontera de investigación se ha desplazado hacia los exámenes de subespecialidades.
Si bien los modelos de IA muestran dominio en subespecialidades estructuradas como cirugía o urología3, su aplicación en psiquiatría permanece inexplorada. Los estudios iniciales indican que la IA se desempeña adecuadamente en exámenes de certificación psiquiátrica, aunque su precisión suele ser inferior a la obtenida en medicina general4–6. Además, la literatura existente presenta 3 limitaciones: el uso de arquitecturas de modelos más antiguos, la falta de comparabilidad directa entre modelos de última generación y la escasez de datos de regiones en desarrollo.
Este estudio compara el rendimiento de 4 modelos de IA de última generación (GPT-5, Claude 4.5 Sonnet, Gemini 2.5 Flash y DeepSeek V3) en el Examen Nacional de Subespecialidad de Psiquiatría de Perú (2022–2025).
Material y métodosDiseño y contextoSe realizó un estudio transversal comparando el rendimiento de modelos de IA en un examen médico de alto riesgo. El manuscrito sigue las pautas STROBE para investigación observacional7.
El examen evaluado fue el Examen Nacional de Subespecialidad de Psiquiatría de Perú, organizado anualmente por CONAREME. Consta de 100 preguntas de opción múltiple y evalúa 2 subespecialidades con el mismo instrumento: psiquiatría del niño y del adolescente, y psiquiatría de las adicciones.
Unidad de análisisSe evaluaron 4 modelos de IA seleccionados por su rendimiento en evaluaciones internacionales y disponibilidad vía API: GPT-5 (OpenAI), Claude 4.5 Sonnet (Anthropic), Gemini 2.5-Flash (Google) y DeepSeek V3 (DeepSeek). El grupo de comparación consistió en 42 psiquiatras licenciados que rindieron el examen entre 2022 y 2025.
El conjunto de datos incluyó las 400 preguntas administradas entre 2022 y 2025 (n = 100 por año). La edición de 2022 utilizó 5 opciones (A-E); las de 2023–2025, 4 opciones (A-D). CONAREME no ha publicado informes técnicos ni evidencia de validez psicométrica para este instrumento. Todos los exámenes están disponibles en https://www.conareme.org.pe/web/.
VariableLa variable de resultado primaria fue la precisión, definida como el porcentaje de respuestas correctas por modelo en relación con la clave oficial. Para los psiquiatras, se utilizó la puntuación bruta agregada; las puntuaciones a nivel de ítems individuales no estaban disponibles. La variable secundaria fue la concordancia intermodelo.
Las variables independientes fueron: año del examen (2022–2025), competencia (diagnóstico, tratamiento, conocimiento general), tipo de pregunta (basada en hechos frente a basada en casos) y tema de subespecialidad. Las categorías temáticas (neurociencia, psicopatología general, psiquiatría del adulto, psiquiatría del niño y del adolescente, psiquiatría de enlace, adicciones y psicoterapia) fueron codificadas siguiendo el programa de estudios del RANZCP.
ProcedimientosSe empleó una estrategia de zero-shot prompting. Cada modelo fue instruido a actuar como «psiquiatra experto y profesor universitario», generando respuestas en formato JSON con justificación y clave seleccionada. No se proporcionaron ejemplos (few-shot) ni herramientas externas (Chain-of-Thought), con el fin de evaluar el conocimiento intrínseco de los modelos. Para minimizar el sesgo de selección, se incluyó el universo completo de preguntas.
Análisis de datosLa precisión se comparó entre modelos mediante la prueba de chi-cuadrado, y la concordancia inter-modelo se evaluó mediante la Kappa de Fleiss. La precisión se expresó como porcentaje con intervalos de confianza (IC) del 95%. Un valor de p < 0,05 se consideró estadísticamente significativo. Todos los análisis se realizaron en R versión 4.1,2 (R Foundation for Statistical Computing). Para los 12 ítems donde todos los modelos fallaron concurrentemente, se realizó un análisis cualitativo de contenido para identificar patrones de similitud en los fallos.
ResultadosComo se muestra en la tabla 1, todos los modelos superaron el 90% de precisión general, sin diferencias estadísticamente significativas (p = 0,32). La concordancia intermodelo fue moderada (kappa = 0,59). Gemini 2.5 obtuvo la precisión más alta (94,2%), seguido de Claude 4.5 (91,8%), GPT-5 (91,5%) y DeepSeek V3 (91,0%). El análisis temporal mostró precisión alta en todas las cohortes. El examen de 2024 presentó la mayor concordancia (kappa = 0,69), y el de 2023 la mayor precisión de un solo modelo (96,0%, Gemini 2.5).
Precisión comparativa y concordancia interobservadores de 4 modelos de inteligencia artificial en el Examen de Subespecialidad de Psiquiatría de Perú (2022–2025)
| Gemini 2.5n (%) | DeepSeek V3n (%) | GPT-5n (%) | Claude 4.5n (%) | pa | Tasa de acuerdo % | Kappa de Fleiss | |
|---|---|---|---|---|---|---|---|
| General | 377/400 (94,2) | 364/400 (91) | 366/400 (91,5) | 367/400 (91,8) | 0,3233 | 89 | 0,5922 |
| Año | |||||||
| 2022 (n = 100) | 92/100 (92) | 88/100 (88) | 90/100 (90) | 90/100 (90) | 0,8281 | 88 | 0,6481 |
| 2023 (n = 100) | 96/100 (96) | 89/100 (89) | 89/100 (89) | 91/100 (91) | 0,2507 | 85 | 0,4677 |
| 2024 (n = 100) | 94/100 (94) | 92/100 (92) | 94/100 (94) | 91/100 (91) | 0,8003 | 92 | 0,6902 |
| 2025 (n = 100) | 95/100 (95) | 95/100 (95) | 93/100 (93) | 95/100 (95) | 0,9016 | 91 | 0,5511 |
| Competencia | |||||||
| Diagnóstico (n = 221) | 212/221 (95,9) | 204/221 (92,3) | 203/221 (91,9) | 210/221 (95) | 0,2073 | 90 | 0,5541 |
| Tratamiento (n = 102) | 92/102 (90,2) | 91/102 (89,2) | 93/102 (91,2) | 90/102 (88,2) | 0,9121 | 89,20 | 0,6815 |
| Conocimiento General (n = 77) | 73/77 (94,8) | 69/77 (89,6) | 70/77 (90,9) | 67/77 (87) | 0,4145 | 85,70 | 0,5305 |
| Tipo de pregunta | |||||||
| Basada en hechos (n = 217) | 206/217 (94,9) | 197/217 (90,8) | 194/217 (89,4) | 192/217 (88,5) | 0,094 | 87,10 | 0,5869 |
| Basada en casos (n = 183) | 171/183 (93,4) | 167/183 (91,3) | 172/183 (94) | 175/183 (95,6) | 0,395 | 91,30 | 0,5983 |
| Tema | |||||||
| Adicciones (n = 33) | 32/33 (97) | 27/33 (81,8) | 28/33 (84,8) | 29/33 (87,9) | 0,2633 | 75,80 | 0,3836 |
| Psiquiatría general (n = 125) | 116/125 (92,8) | 116/125 (92,8) | 114/125 (91,2) | 116/125 (92,8) | 0,952 | 93,60 | 0,7532 |
| Psiquiatría de niños y adolescentes (n = 49) | 45/49 (91,8) | 45/49 (91,8) | 46/49 (93,9) | 46/49 (93,9) | 0,9586 | 93,90 | 0,7436 |
| Psicopatología general (n = 74) | 71/74 (95,9) | 68/74 (91,9) | 67/74 (90,5) | 68/74 (91,9) | 0,622 | 86,50 | 0,4762 |
| Psiquiatría de enlace (n = 67) | 62/67 (92,5) | 61/67 (91) | 62/67 (92,5) | 62/67 (92,5) | 0,9845 | 89,60 | 0,6039 |
| Neurociencias (n = 29) | 29/29 (100) | 27/29 (93,1) | 28/29 (96,6) | 27/29 (93,1) | 0,5127 | 86,20 | 0,0943 |
| Psicoterapia (n = 23) | 22/23 (95,7) | 20/23 (87) | 21/23 (91,3) | 19/23 (82,6) | 0,5234 | 82,60 | 0,5512 |
El rendimiento de la IA mostró una tendencia ascendente constante, mientras que el de los psiquiatras fue variable (fig. 1). Las puntuaciones medias de la IA aumentaron de 90,0% (IC 95%: 87,1–92,9%) en 2022 a 94,5% (IC 95%: 92,3–96,7%) en 2025. Los psiquiatras iniciaron en 78,5% (IC 95%: 72,3–84,7%) en 2022, descendieron a 75,3% en 2023 y alcanzaron 84,2% (IC 95%: 81,6–86,8%) en 2025. La brecha de rendimiento entre la IA y los psiquiatras varió por año: 13,5 puntos porcentuales en 2022, 20,8 en 2023, 12,5 en 2024 y 10,8 en 2025.
Los modelos fallaron concurrentemente en 12 ítems (material complementario). Dos fallos se debieron a una mala interpretación por parte de la IA. Los 10 restantes se atribuyen a problemas de construcción: 6 involucraron diseño defectuoso o ambiguo (dobles respuestas correctas, viñetas clínicas vagas o errores de redacción). Los 4 restantes presentaban conflictos entre la clave oficial y el consenso médico actual, en temas como dependencia de zolpidem, manejo del TDAH en preescolares y marcos de tiempo diagnósticos.
DiscusiónResumen de resultadosLos 4 modelos evaluados alcanzaron precisiones superiores al 90%, sin superioridad estadística entre ellos (p = 0,32, k= 0,59). Todos superaron a los psiquiatras postulantes por 10,8 a 20,8 puntos porcentuales. En los 12 fallos concurrentes, la mayoría (10/12) se atribuyeron a problemas de los ítems, no a limitaciones de los modelos.
Interpretación de resultadosEl rendimiento superior en diagnóstico frente a tratamiento podría reflejar diferencias en la naturaleza cognitiva de ambas tareas. El razonamiento diagnóstico opera como categorización basado en reconocimiento de patrones, una función para la que los modelos de IA parecen estar bien adaptados. Por el contrario, la formulación del tratamiento requiere integrar contraindicaciones, determinantes sociales y guías locales, donde los modelos mostraron debilidad relativa8.
La ausencia de un modelo superior y la concordancia moderada sugieren un posible efecto de techo para preguntas de opción múltiple. Dada esta paridad, la selección de modelos podría priorizar la rentabilidad. DeepSeek V3, por ejemplo, alcanzó un rendimiento equivalente a los demás modelos a un costo de 0,20 USD para las 400 preguntas.
Comparación con estudios previosEstos resultados son consistentes con evaluaciones recientes que confirman puntuaciones cercanas al máximo en modelos de última generación. Sin embargo, contrastan con investigaciones previas donde GPT-4o y versiones anteriores alcanzaron 78 y 81% en exámenes de psiquiatría infantil5,6. La mayor precisión en nuestro estudio (>90%) podría estar relacionada con el uso de modelos más recientes, como GPT-5 y Gemini 2.5. No obstante, esta comparación entre estudios no permite establecer una relación directa.
LimitacionesEste estudio presenta fortalezas relevantes: 400 ítems durante 4 años consecutivos, evaluación simultánea de 4 modelos de última generación y el uso de una estrategia de prompting estandarizada que favorece la replicabilidad.
No obstante, la estrategia de zero-shot prompting puede subestimar la capacidad de los modelos frente a técnicas como few-shot o Chain-of-Thought, lo que constituye un sesgo conservador. Adicionalmente, la clave de respuesta oficial, tanto como el examen carece de validación psicométrica pública, lo que introduce un posible sesgo de medición.
La comparación con psiquiatras se basó en datos agregados, dado que las puntuaciones individuales por ítem no estaban disponibles. Aunque esto no afecta la comparación global, impide análisis por competencia, tipo de pregunta o subespecialidad. Los modelos, además, no experimentan estrés ni limitaciones de tiempo, lo que limita la validez ecológica de la comparación.
GeneralizabilidadEstos resultados son aplicables a exámenes de psiquiatría en Latinoamérica, anclados en el DSM-5/CIE-11, circunscritos a los niveles de «saber» y «saber cómo» de la pirámide de Miller. La reproducibilidad en otros contextos requiere cautela: marcos curriculares y formatos de evaluación varían entre países. Exámenes con preguntas de respuesta extendida o evaluaciones clínicas estructuradas podrían arrojar resultados diferentes.
ImplicanciasEl bajo costo y la alta precisión (>90%) de los modelos evaluados respaldan su potencial como herramientas de tutoría, particularmente en entornos con recursos limitados. Además, el hallazgo de que el 83% de los fallos concurrentes correspondieron a problemas de construcción de ítems sugiere, además, su utilidad para auditar y mejorar la calidad de las preguntas de examen. La investigación futura debería evaluar la validez ecológica de estas herramientas dentro de flujos de trabajo clínicos reales.
En conclusión, todos los modelos de IA evaluados alcanzaron una precisión superior al 90%, superando consistentemente a los psiquiatras postulantes. En el dominio de la evocación de hechos evaluada mediante opción múltiple, el rendimiento de la IA igualó o excedió al de los especialistas humanos. Estos hallazgos respaldan la utilidad de la IA como herramienta de bajo costo para la autoevaluación educativa y la auditoría de calidad de preguntas de examen. Asimismo, sugieren que las evaluaciones en educación médica podrían evolucionar hacia la medición de competencias de juicio clínico y razonamiento terapéutico, dimensiones que no fueron evaluadas en el presente estudio.
Responsabilidades éticasLa revisión y aprobación por parte de un comité de ética fue eximida para el presente estudio, dado que se basó exclusivamente en el análisis de una base de datos secundaria, de acceso público y completamente anonimizada. La información utilizada no contenía identificadores personales directos o indirectos que permitieran vincular los datos a individuos específicos.
FinanciaciónLa Universidad San Ignacio de Loyola financió el cargo de procesamiento del artículo (APC) (Código: USIL-2025). La obtención de fondos estuvo a cargo del autor C.C.C. El financiador no participó en el diseño del estudio, la recopilación y el análisis de datos, la decisión de publicación ni la preparación del manuscrito.
Conflicto de interesesLos autores declaran que no tienen conflictos de intereses.
Declaración de uso de inteligencia artificialSí, evaluamos el rendimiento de 4 modelos largos de lenguaje: GPT-5 (OpenAI), Claude 4.5 Sonnet (Anthropic), Gemini 2.5-Flash (Google) y DeepSeek V3 (DeepSeek).
ContribucionesJavier A. Flores-Cohaila: Trabajó en la conceptualización, metodología, redacción, borrador original, redacción, revisión y edición, aprobación de la versión final. Jeff Huarcaya-Victoria: Trabajó en la metodología, redacción, borrador original y aprobación de la versión final. César Copaja-Corzo: Trabajó en la supervisión, revisión crítica del contenido intelectual, financiamiento, redacción, revisión y edición.
Disponibilidad de datos y materialesLos datos anónimos están disponibles públicamente en el portal de CONAREME: https://www.conareme.org.pe/web/.






