lunes, 3 de agosto de 2026

IA y modelos

OpenAI lanza GPT-5.4 con nuevos modelos de razonamiento y Pro

OpenAI lanzó GPT-5.4, un nuevo modelo fundacional que presenta una mayor eficiencia de tokens, tasas de error reducidas y ventanas de contexto de API de hasta 1 millón de tokens.

OpenAI launches GPT-5.4 with new reasoning and pro models
Foto: OpenAI

El jueves, OpenAI lanzó GPT-5.4, un nuevo modelo fundacional presentado como su modelo más capaz y eficiente para el trabajo profesional. Además de la versión estándar, GPT-5.4 está disponible como un modelo de razonamiento, llamado GPT-5.4 Thinking, y una versión optimizada de alto rendimiento, llamada GPT-5.4 Pro. La empresa afirma que el modelo es significativamente más fiable que su predecesor, GPT 5.2. Según OpenAI, GPT-5.4 tiene un 33% menos de probabilidades de cometer errores en afirmaciones individuales en comparación con GPT 5.2, y las respuestas generales tienen un 18% menos de probabilidades de contener errores.

Para los desarrolladores, la versión API de GPT-5.4 introduce ventanas de contexto de hasta 1 millón de tokens, lo que representa la ventana de contexto más grande disponible de OpenAI. También cuenta con un nuevo sistema Tool Search diseñado para gestionar la llamada a herramientas. Anteriormente, los prompts del sistema debían establecer definiciones para todas las herramientas disponibles al llamar a un modelo, lo que consumía una cantidad significativa de tokens a medida que crecía la biblioteca de herramientas. El nuevo sistema Tool Search permite al modelo buscar definiciones de herramientas solo cuando es necesario, lo que hace que el modelo sea más eficiente en tokens que su predecesor. Esto resulta en solicitudes más rápidas y económicas en sistemas con muchas herramientas disponibles.

El modelo también ha mostrado un sólido desempeño en benchmarks profesionales, incluyendo puntuaciones récord en los benchmarks de uso de computadora OSWorld-Verified y WebArena Verified. GPT-5.4 obtuvo un 83% en GDPval, que es la prueba de OpenAI para tareas de trabajo de conocimiento. También tomó la delantera en el benchmark APEX-Agents, una prueba proporcionada por Mercor para evaluar habilidades profesionales en derecho y finanzas. Brendan Foody, el CEO de Mercor, declaró que el modelo “[GPT-5.4] sobresale en la creación de entregables de largo plazo, como presentaciones, modelos financieros y análisis legales”. Foody también señaló que el modelo ofrece un rendimiento superior mientras funciona más rápido y a un costo menor que los modelos de frontera competitivos.

OpenAI también abordó las preocupaciones de seguridad con respecto a los modelos de razonamiento. A los investigadores de seguridad de IA les ha preocupado durante mucho tiempo que los modelos de razonamiento pudieran tergiversar su cadena de pensamiento (chain-of-thought)—el comentario continuo que muestra el proceso de pensamiento del modelo. Sin embargo, las evaluaciones de OpenAI indican que es menos probable que ocurra un engaño en la versión Thinking de GPT-5.4. Según OpenAI, esto sugiere que el modelo carece de la capacidad de ocultar su razonamiento y que el monitoreo de la cadena de pensamiento sigue siendo una herramienta de seguridad eficaz.

Por qué importa

El último lanzamiento de OpenAI se centra en la fiabilidad y la eficiencia para tareas profesionales, lo que señala un cambio hacia modelos que pueden manejar trabajos complejos y de largo plazo con menos alucinaciones.