IA y modelos
Anthropic rediseña sus pruebas de contratación a medida que los modelos de IA igualan el desempeño humano
Anthropic está rediseñando sus pruebas técnicas de contratación porque sus modelos de IA más recientes, específicamente Claude Opus 4.5, se han vuelto capaces de igualar el desempeño de los mejores candidatos humanos.
Desde 2024, el equipo de optimización de rendimiento de Anthropic ha entregado a los candidatos a puestos de trabajo una prueba para realizar en casa (una evaluación técnica de contratación) para evaluar sus capacidades. Sin embargo, la empresa ahora rediseña repetidamente esta prueba porque sus propios modelos de IA están igualando o superando a los candidatos humanos. Tristan Hume, líder de equipo en Anthropic, describió la historia del desafío en una publicación de blog el miércoles. Hume declaró que cada nuevo modelo de Claude ha obligado al equipo a rediseñar la prueba. Según Hume, al recibir el mismo límite de tiempo, el modelo Claude Opus 4 superó a la mayoría de los candidatos humanos. Si bien ese desempeño aún permitía a la empresa distinguir a los candidatos más fuertes, el modelo posterior, Claude Opus 4.5, igualó incluso a esos candidatos humanos de alto rendimiento.
Aunque Anthropic permite expresamente que los candidatos utilicen herramientas de IA en la prueba para realizar en casa, el rápido avance de estos modelos ha creado un problema significativo de evaluación de candidatos. Si los candidatos humanos ya no pueden mejorar el resultado del modelo, la prueba solo mide los diferentes modelos utilizados en lugar de identificar al mejor talento. “Bajo las restricciones de la prueba para realizar en casa, ya no teníamos forma de distinguir entre el resultado de nuestros mejores candidatos y nuestro modelo más capaz”, escribió Hume.
Para resolver esto, Hume diseñó una nueva prueba que se centra menos en la optimización de hardware, haciéndola lo suficientemente novedosa como para confundir a las herramientas de IA contemporáneas. Como parte de su publicación, también compartió la prueba original para ver si alguien podía desarrollar una mejor solución. Hume lanzó un desafío abierto a los solicitantes, escribiendo que si pueden superar a Claude Opus 4.5, a la empresa le encantaría saber de ellos. Esta situación destaca una ironía más amplia: los laboratorios de IA ahora están luchando con los mismos problemas de pruebas asistidas por IA que han interrumpido a las escuelas y universidades de todo el mundo.
Por qué importa
El rápido avance de modelos de IA como Claude Opus 4.5 está creando una nueva crisis de evaluación para los empleadores. Las pruebas técnicas estándar ya no son suficientes para diferenciar al mejor talento humano del resultado de las máquinas, lo que obliga a las empresas a desarrollar métodos de evaluación completamente nuevos.