IA y modelos
Un modelo de OpenAI iguala a médicos humanos en un estudio de triaje de emergencia
Un estudio de Harvard halló que el modelo o1 de OpenAI tuvo un desempeño nominalmente mejor o a la par que médicos de medicina interna en triaje de emergencia, aunque expertos advierten contra exagerar los resultados.
Un nuevo estudio publicado esta semana en Science evaluó los modelos o1 y 4o de OpenAI frente a médicos humanos utilizando 76 pacientes de la sala de emergencias del Beth Israel Deaconess Medical Center. La investigación fue dirigida por la Harvard Medical School y realizada en el Beth Israel Deaconess Medical Center, comparando el desempeño de los modelos de inteligencia artificial frente a dos médicos adjuntos —médicos experimentados que han completado su residencia—. Durante el triaje inicial, que es el proceso de determinar la prioridad de los tratamientos de los pacientes según la gravedad de su condición, el modelo o1 logró un diagnóstico exacto o muy cercano en el 67% de los casos. En comparación, el primer médico adjunto logró un diagnóstico exacto o cercano el 55% de las veces, mientras que el segundo médico adjunto alcanzó la marca el 50% de las veces.
El estudio señaló que, en cada punto de contacto diagnóstico, o1 tuvo un desempeño nominalmente mejor o a la par que los dos médicos adjuntos y el modelo 4o. Arjun Manrai, quien dirige un laboratorio de IA en la Harvard Medical School y es uno de los autores principales del estudio, declaró que los investigadores probaron el modelo de IA contra prácticamente todos los puntos de referencia, y este eclipsó tanto a los modelos anteriores como a las líneas base de los médicos.
A pesar de estos resultados, la metodología del estudio ha enfrentado críticas de expertos médicos. Kristen Panthagani, una médica de emergencias que criticó el estudio, señaló que la investigación comparó los diagnósticos de la IA con los de médicos de medicina interna en lugar de especialistas en salas de emergencia. “Si vamos a comparar herramientas de IA con la capacidad clínica de los médicos, deberíamos empezar comparándolas con médicos que realmente practican esa especialidad”, dijo Kristen Panthagani, médica de emergencias. Señaló que, como médica de sala de emergencias que ve a un paciente por primera vez, el objetivo principal no es adivinar un diagnóstico definitivo, sino determinar si el paciente tiene una condición que podría matarlo.
Además, el estudio no afirma que la IA esté lista para tomar decisiones de vida o muerte en la sala de emergencias. Los investigadores enfatizaron que los modelos solo fueron probados con información basada en texto, señalando que estudios existentes sugieren que los modelos fundacionales actuales son más limitados al razonar sobre entradas que no son de texto. Adam Rodman, médico del Beth Israel y uno de los autores principales del estudio, también advirtió que actualmente no existe un marco formal de responsabilidad con respecto a los diagnósticos generados por IA, y que los pacientes aún quieren que los humanos los guíen a través de decisiones de tratamiento desafiantes.
Por qué importa
El estudio destaca el potencial de la IA en entornos clínicos, al tiempo que subraya la necesidad crítica de una validación rigurosa y específica de la especialidad antes de que se pueda confiar en estas herramientas para decisiones médicas de alto riesgo.