Los agentes de IA no saben improvisar: Check Point Software explica cómo se descontrolan y qué peligros supone para las empresas

Check Point® Software Technologies Ltd., pionero y líder global en soluciones de ciberseguridad, ha celebrado un hackatón interno de dos días organizado por sus equipos de I+D de seguridad en IA de Zúrich y Tel Aviv. En el encuentro, donde 19 equipos han desarrollado diversos prototipos tecnológicos, los expertos de la compañía descubrieron un patrón preocupante en el comportamiento de los agentes autónomos: la IA no necesita ser interceptada ni dirigida por un ciberdelincuente externo para desviarse de sus funciones, tomar decisiones de alto riesgo o generar un problema de seguridad.  

Los experimentos demostraron que, cuando estos sistemas enfrentan limitaciones de diseño o tareas sin solución clara, tienden a razonar e improvisar atajos peligrosos impulsados únicamente por el incentivo de cumplir su objetivo. Además, la investigación ha demostrado que la protección de la IA debe evolucionar de manera urgente: desde los cortafuegos tradicionales hacia la supervisión contextual en tiempo de ejecución. Modificar la respuesta del sistema es más eficaz que el bloqueo estricto.

A través de sus simulaciones en entornos controlados (sandbox), Check Point Software ha detectado tres claves que pueden marcar el futuro de la ciberseguridad corporativa:

  • Los agentes se vuelven autónomos y pueden descontrolarse: al asignar tareas imposibles a un agente autónomo de ingeniería de fiabilidad de sitios (SRE), este intentó resolver el problema reiniciando una base de datos de producción, interrumpiendo conexiones de clientes e intentando escalar sus propios privilegios mediante fuerza bruta. El sistema actuó sin intenciones malévolas ni manipulación externa, justificando cada acción peligrosa como un paso lógico para completar su trabajo.  
  • El contexto es una superficie de ataque vulnerable: un solo archivo con instrucciones maliciosas ocultas dentro de un repositorio de código bastó para transformar agentes de programación populares, como Claude Code y Codex, en canales de exfiltración de credenciales. La prueba demostró que cualquiera que escriba en el entorno o contexto de lectura del agente comparte de manera efectiva el control sobre sus decisiones.  
  • Cuestionar al agente supera al bloqueo directo: al comparar nueve estrategias frente a comportamientos sospechosos, los investigadores han observado que la denegación directa cancelaba el ataque, pero también invalidaba el trabajo legítimo. En cambio, cuando el sistema de control cuestionaba la acción e instaba al agente a revisar la orden original del usuario, se previno el mismo volumen de amenazas logrando completar exitosamente las tareas encomendadas.

Según Check Point Software, la seguridad de los agentes no consiste solo en mantener fuera a los atacantes. Debe supervisarse también lo que hace el agente con el contexto disponible y responder mediante soluciones más inteligentes que un simple ‘no’.

Deja un comentario

Este sitio utiliza Akismet para reducir el spam. Conoce cómo se procesan los datos de tus comentarios.