IA y modelos
Un benchmark de Mercor muestra que los modelos de IA tienen dificultades con tareas profesionales
El nuevo benchmark APEX-Agents de Mercor revela que la mayoría de los modelos de IA tienen dificultades para realizar tareas profesionales complejas y multidominio, con el modelo de mayor rendimiento logrando un 24% de precisión.
Casi dos años después de que el CEO de Microsoft, Satya Nadella, predijera que la IA reemplazaría el trabajo intelectual, un nuevo benchmark llamado APEX-Agents, desarrollado por la empresa de datos de entrenamiento Mercor, revela que la mayoría de los modelos de IA tienen dificultades para realizar trabajo profesional, definido como servicios profesionales como derecho, banca y contabilidad. Según la investigación, todos los laboratorios de IA están obteniendo una calificación reprobatoria en el benchmark, ya que los modelos tienen dificultades para completar tareas complejas que reflejan entornos profesionales reales.
El benchmark está diseñado para reflejar servicios profesionales del mundo real al evaluar la capacidad de los sistemas para manejar entornos multidominio. El CEO de Mercor, Brendan Foody, señaló que los modelos tienen dificultades para localizar información en múltiples dominios, lo cual es un requisito fundamental del trabajo profesional humano. Foody explicó que los trabajos humanos no implican que un solo individuo proporcione todo el contexto en un solo lugar, sino que requieren operar a través de diversas herramientas como Slack y Google Drive.
Los escenarios del benchmark están tomados de profesionales reales. Por ejemplo, una tarea legal pregunta si una empresa puede tratar las exportaciones de registros que contienen datos personales a un proveedor de análisis de EE. UU. durante los primeros 48 minutos de una interrupción de producción en la UE como coherente con el Artículo 49 de las leyes de privacidad de la UE. Responder a tales preguntas requiere una evaluación profunda de las políticas de la empresa y las regulaciones regionales.
Al ser evaluados en estas tareas, los modelos mostraron tasas de éxito bajas. Gemini 3 Flash logró la puntuación más alta con un 24% de precisión one-shot, definida como el rendimiento de un modelo en un solo intento. GPT-5.2 le siguió de cerca con un 23% de precisión, mientras que Opus 4.5, Gemini 3 Pro y GPT-5 obtuvieron aproximadamente un 18%. Esta evaluación contrasta con el benchmark GDPval de OpenAI. Mientras que GDPval mide el conocimiento general en una amplia gama de profesiones, el benchmark APEX-Agents se centra en tareas sostenidas dentro de un conjunto limitado de servicios profesionales de alto valor.
A pesar de las bajas puntuaciones iniciales, Foody espera una mejora rápida. “En este momento es justo decir que es como un pasante que acierta una cuarta parte de las veces, pero el año pasado era el pasante que acertaba el cinco o el 10% de las veces. Ese tipo de mejora año tras año puede tener un impacto muy rápido”, dijo Foody.
Por qué importa
El benchmark APEX-Agents proporciona una nueva forma de medir cómo se desempeñan los modelos de IA en tareas complejas y multidominio típicas de los servicios profesionales, revelando que los modelos actuales tienen dificultades para cumplir con los estándares de los profesionales humanos.