IA y modelos
Investigadores critican las barreras de seguridad del nuevo modelo Fable de Anthropic
Anthropic lanzó Fable, un modelo de IA enfocado en ciberseguridad, pero los investigadores reportan que sus barreras de seguridad excesivamente agresivas bloquean incluso tareas inofensivas.
El martes, Anthropic lanzó Fable, una versión pública y limitada de su modelo de ciberseguridad Mythos, que fue lanzado originalmente en abril. El lanzamiento ha enfrentado un rechazo inmediato por parte de profesionales de la ciberseguridad debido a sus restrictivas medidas de seguridad. Anthropic implementó barreras de seguridad (restricciones programadas en un modelo de IA) para limitar el riesgo de que Fable pudiera ser utilizado para desarrollar malware o comprometer software. Además, las restricciones sobre temas de biología tienen la intención de prevenir el desarrollo de armas biológicas. Sin embargo, los investigadores de ciberseguridad están descontentos con estas restricciones, argumentando que limitan severamente la utilidad del modelo.
Los investigadores de seguridad reportan que las barreras de seguridad de Fable son excesivamente sensibles e interrumpen el trabajo legítimo. Valentina “Chompie” Palmiotti, investigadora de seguridad en IBM X-Force, declaró que “[Fable] rechaza cualquier solicitud que podría estar relacionada tangencialmente con la ciberseguridad. Incluso tareas inofensivas como leer una publicación de blog”, lo que limita su utilidad para el trabajo de seguridad legítimo. Matt Suiche, veterano de la ciberseguridad y miembro del personal técnico de Tolmo (startup de ciberseguridad con IA), explicó que cuando los usuarios piden al modelo que escriba código seguro, este asume que la solicitud es un trabajo relacionado con la ciberseguridad en lugar de mejores prácticas de ingeniería de software estándar, lo que resulta en una degradación. Suiche añadió que las barreras de seguridad parecen basarse en palabras clave, lo que significa que cualquier término dentro del campo léxico de la ciberseguridad activa las medidas de seguridad. Otro investigador señaló que incluso solicitar una revisión de código activa las barreras. Cuando Fable alcanza una barrera de seguridad, recurre a Claude Opus 4.8, el modelo de respaldo utilizado cuando se activan dichas barreras.
A pesar de la fricción, Suiche señaló que las estrictas barreras de seguridad son comprensibles en los primeros días del lanzamiento, sugiriendo que evolucionarán a medida que las empresas de IA colaboren más con las firmas de ciberseguridad. Para evitar estas limitaciones, Anthropic requiere que los profesionales de la ciberseguridad postulen a su Cyber Verification Program (programa de acceso para profesionales de ciberseguridad) para obtener acceso con menos restricciones. Este enfoque refleja al de su competidor OpenAI, que opera un programa similar llamado Trusted Access for Cyber. Mientras tanto, Anthropic ha ampliado el acceso al modelo subyacente más potente, Mythos. Tras restringir inicialmente Mythos a un número limitado de organizaciones bajo Project Glasswing —un esfuerzo para implementar el modelo para asegurar software e infraestructura crítica— en abril, Anthropic amplió el acceso la semana pasada a cientos de organizaciones en 15 países.
Por qué importa
La tensión entre las barreras de seguridad y la utilidad del modelo destaca el desafío continuo para los laboratorios de IA al equilibrar la mitigación de riesgos con las necesidades prácticas de los profesionales de la ciberseguridad.