IA médicaeducación médicaseguridad clínicasalud digital

IA médica: la capacitación detrás de 34 puntos más

Un ensayo aleatorizado con 58 médicos encontró mejores resultados con GPT-4o después de capacitación estructurada. Qué midió y cuáles son sus límites.

SaludTotal Team
IA médica: la capacitación detrás de 34 puntos más

SaludTotal

Digitaliza tu consultorio con agenda, expediente y facturación

Conoce cómo SaludTotal ayuda a clínicas y consultorios a operar con más orden y menos trabajo manual.

IA médica: la capacitación detrás de 34 puntos más

Un resultado llamativo circula en la conversación sobre inteligencia artificial y medicina: médicos con acceso a GPT-4o obtuvieron 34.3 puntos porcentuales más en el diagnóstico final que un grupo con recursos convencionales. El número importa, pero sólo se entiende bien con el resto del diseño: todos los participantes habían cursado 20 horas de alfabetización en IA, trabajaron con casos simulados y el resultado de 34.3 puntos fue exploratorio.

El estudio no demuestra que una IA pueda sustituir al médico ni que ese beneficio se transfiera automáticamente a pacientes reales. Sí deja una lección práctica para clínicas y programas de educación médica: habilitar una herramienta no equivale a enseñar a usarla.

Resumen del ensayo con 58 médicos, 20 horas de capacitación y diferencias de 27.5 y 34.3 puntos

Qué hizo realmente el estudio

El ensayo aleatorizado, simple ciego, se realizó en Pakistán entre enero y mayo de 2025. Ingresaron 60 médicos licenciados y 58 completaron el estudio, 29 por grupo. En conjunto resolvieron 342 casos a partir de hasta seis viñetas clínicas.

Antes de la asignación, todos completaron un currículo de 20 horas que cubría:

  • capacidades y limitaciones de los modelos de lenguaje;
  • uso apropiado de la herramienta;
  • riesgo de respuestas falsas presentadas con seguridad, conocidas como alucinaciones;
  • necesidad de verificar la salida antes de incorporarla al razonamiento clínico.

Después, un grupo pudo usar GPT-4o además de fuentes convencionales, como buscadores y literatura médica. El grupo control utilizó únicamente esos recursos convencionales. Ambos tuvieron 75 minutos para revisar hasta seis casos clínicos simulados.

La comparación, por tanto, no fue entre “médicos capacitados” y “médicos sin capacitación”. Todos recibieron la misma alfabetización; lo que cambió fue el acceso al modelo durante la resolución de los casos.

27.5 puntos en el resultado principal; 34.3 en uno exploratorio

El desenlace principal fue una puntuación de razonamiento diagnóstico basada en una rúbrica validada por expertos. Incluía hipótesis, evidencia a favor y en contra, diagnóstico final y siguientes pasos.

El grupo con GPT-4o obtuvo una media de 71.4%, frente a 42.6% con recursos convencionales. La diferencia ajustada fue de 27.5 puntos porcentuales.

El dato de 34.3 puntos porcentuales corresponde al análisis del diagnóstico final, considerado exploratorio. Su intervalo de confianza de 95% fue de 29.7 a 38.8 puntos. Es una señal relevante, pero no debe presentarse como si fuera el único resultado ni como una medida directa de desenlaces en pacientes.

El tiempo dedicado por caso fue parecido entre grupos. Es decir, el estudio no encontró que la herramienta hiciera el ejercicio sustancialmente más rápido.

Por qué las 20 horas de capacitación cambian la interpretación

La IA generativa puede proponer hipótesis plausibles y organizar información, pero también puede omitir un dato crítico, inventar una referencia o sostener una respuesta incorrecta con lenguaje convincente. Sin formación, una salida fluida puede confundirse con evidencia.

La capacitación estructurada del ensayo enseñó a los médicos a tratar la salida como una propuesta que debe verificarse, no como una orden. Esa diferencia es central para cualquier implementación responsable.

En una clínica, la formación no debería limitarse a explicar dónde hacer clic. Debe responder preguntas operativas y clínicas:

  1. ¿Para qué tareas está autorizada la herramienta?
  2. ¿Qué datos puede recibir y cuáles no deben compartirse?
  3. ¿Cómo se verifica una afirmación o una referencia?
  4. ¿Quién conserva la responsabilidad de la decisión?
  5. ¿Cómo se reporta una salida insegura o incorrecta?

Lo que el estudio no permite afirmar

El diseño tiene límites que deben aparecer junto al resultado:

  • participaron 58 médicos que completaron el protocolo;
  • se usaron seis viñetas clínicas, no consultas reales;
  • fue realizado en instituciones de un solo país;
  • el diagnóstico final fue un análisis exploratorio;
  • no midió seguridad, evolución ni desenlaces de pacientes en la práctica cotidiana;
  • no evaluó SaludTotal ni autoriza atribuirle el resultado al sistema.

Tampoco significa que “la IA diagnostica mejor”. El estudio evaluó médicos con acceso a una herramienta después de una capacitación común. El criterio, la verificación y la responsabilidad siguieron siendo humanos.

Tres reglas antes de conectar IA con un flujo clínico

1. Conocer el límite de la tarea

No es lo mismo resumir documentación, estructurar datos o preparar un borrador que emitir un diagnóstico o elegir un tratamiento. Cada función necesita un propósito explícito, supervisión y una frontera clara.

2. Verificar antes de incorporar

Una respuesta útil debe contrastarse con el expediente, los hallazgos del paciente y fuentes clínicas confiables. Si la herramienta cita una guía o un artículo, la referencia debe existir y corresponder a lo afirmado.

3. Mantener la decisión en el médico

La IA puede apoyar una tarea, pero el profesional conserva el contexto completo y la responsabilidad clínica. Un flujo seguro deja claro quién revisa, corrige y autoriza la información.

Cómo aterrizarlo en un expediente clínico electrónico

En SaludTotal, el principio es: tú diagnosticas; la IA captura. La tecnología puede ayudar a documentar y estructurar lo expresado durante la consulta, mientras el médico revisa los campos y conserva el control clínico.

La imagen generada para esta pieza dramatiza un contexto de capacitación; no representa una función autónoma de diagnóstico ni una pantalla ficticia del producto. Cuando se comunica una función de SaludTotal, debe mostrarse el flujo real y verificable del sistema.

Antes de activar IA en una clínica, documenta el propósito, las fuentes permitidas, el método de verificación, la supervisión humana y el proceso para reportar errores. La capacitación no es un complemento: es parte del control de riesgo.

Fuente primaria: Qazi, I. A. et al. Large language model diagnostic assistance for physicians in a lower-middle-income country: a randomized controlled trial. Nature Health (2026). https://www.nature.com/articles/s44360-025-00007-8

Capacita antes de automatizar

Si tu clínica está evaluando IA para documentación y expediente clínico electrónico, empieza por definir límites y responsabilidades. Conoce cómo SaludTotal integra tecnología con control médico en saludtotal.mx.

Recursos para avanzar

Demo SaludTotal

Digitaliza tu consultorio con agenda, expediente y facturación

Conoce cómo SaludTotal ayuda a clínicas y consultorios a operar con más orden y menos trabajo manual.

Comenzar ahora

Newsletter SaludTotal

Recibe guías y novedades para digitalizar tu clínica

Suscríbete para recibir contenido práctico sobre expediente clínico, NOM-004, receta electrónica e IA en salud.

Sin spam. Solo contenido útil para médicos, clínicas y hospitales.

¿Dudas? Escríbenos