IA y modelos
OpenAI: es poco probable que la inyección de prompts se resuelva por completo
OpenAI admite que es poco probable que los ataques de inyección de prompts contra navegadores de IA se resuelvan por completo, lo que lleva a la empresa a utilizar atacantes automatizados para reforzar sus defensas.
En una publicación de blog publicada el lunes, OpenAI reconoció que es poco probable que la inyección de prompts se resuelva por completo. La empresa admitió que el “modo agente” en su navegador ChatGPT Atlas, lanzado en octubre, amplía la superficie de amenaza de seguridad para los usuarios en la web abierta. OpenAI comparó la vulnerabilidad con amenazas web existentes como estafas e ingeniería social, afirmando que considera la inyección de prompts como un desafío de seguridad de IA a largo plazo que requerirá actualizaciones defensivas continuas. La admisión destaca la dificultad de asegurar agentes de IA que interactúan con datos no confiables en la web abierta, donde las instrucciones maliciosas pueden manipular fácilmente su comportamiento.
Para abordar estos riesgos persistentes, OpenAI está implementando un atacante automatizado basado en LLM. Este sistema es un bot entrenado mediante aprendizaje por refuerzo para simular hackers que intentan introducir instrucciones maliciosas a un agente de IA. Al probar ataques en un entorno simulado, el atacante automatizado puede descubrir nuevas estrategias de ataque internamente antes de que sean explotadas. OpenAI señaló que su atacante entrenado con aprendizaje por refuerzo puede manipular a un agente para que ejecute flujos de trabajo dañinos complejos y de largo alcance que pueden abarcar decenas (o incluso cientos) de pasos. Este método permite a la empresa adaptar continuamente sus defensas al comportamiento del atacante analizando el razonamiento interno de la IA objetivo.
Otras organizaciones también han señalado la naturaleza a largo plazo de estas vulnerabilidades. A principios de este mes, el National Cyber Security Centre (agencia de ciberseguridad del Reino Unido) advirtió que los ataques de inyección de prompts contra aplicaciones de IA generativa es posible que nunca se mitiguen totalmente, dejando a los sitios web vulnerables a filtraciones de datos. Los expertos en seguridad sugieren que la arquitectura fundamental de los navegadores agentes presenta compensaciones inherentes. Rami McCarthy, investigador principal de seguridad en la firma de ciberseguridad Wiz, señaló que el aprendizaje por refuerzo es una forma de adaptarse continuamente al comportamiento del atacante, pero apuntó a un desafío estructural más amplio. “Una forma útil de razonar sobre el riesgo en los sistemas de IA es la autonomía multiplicada por el acceso”, dijo McCarthy, añadiendo que para la mayoría de los casos de uso cotidianos, los navegadores agentes aún no ofrecen suficiente valor para justificar su perfil de riesgo actual.
Por qué importa
La admisión de OpenAI de que la inyección de prompts es posible que nunca se resuelva por completo destaca los desafíos de seguridad persistentes que enfrentan los agentes de IA a medida que obtienen un acceso más amplio a los datos y sistemas de los usuarios.