
Check Point® Software Technologies Ltd., pionero y líder global en soluciones de ciberseguridad, ha demostrado a través de un análisis de Check Point AI Security Research que el nuevo modelo Jev, un sistema de inteligencia artificial diseñado por TypeSafe AI para devolver decisiones estructuradas e impresas en lugar de texto libre, presenta vulnerabilidades que permiten alterar sus decisiones con un coste medio de unos 50 céntimos por ataque exitoso. Estas respuestas pueden adoptar la forma de una opción, un sí o un no, o una puntuación, acompañadas de una probabilidad. A diferencia de los chatbots convencionales, este modelo está concebido para integrarse directamente en sistemas informáticos que ejecutan acciones basadas en sus veredictos, eliminando la necesidad de una revisión humana previa. Por ejemplo, puede determinar si una candidatura avanza a la siguiente fase, si una recomendación llega a un comité o si se rechaza una reclamación de seguro.
Para evaluar la robustez de Jev frente a posibles ataques, Check Point AI Security Research llevó a cabo un experimento en una aplicación de asistente de auditoría y due diligence. El escenario era una versión ligeramente adaptada del reto Agent Breaker de Check Point. La IA analizó un informe de inversión perteneciente a una empresa de alto riesgo denominada PonziCorp Financial Services. A lo largo de la prueba, se otorgó a un atacante el control sobre una sección específica del documento con el objetivo de degradar la calificación de riesgo de alto a bajo para lograr que el sistema recomendara la inversión.
Los resultados del estudio revelan una vulnerabilidad: todas las configuraciones de seguridad probadas fallaron ante los intentos de manipulación. En concreto, el atacante más fuerte consiguió alterar el veredicto en 25 de 27 intentos, alcanzando el éxito en promedio al cuarto intento de inyección de instrucciones y con un coste promedio de uso de la API de tan solo 50 céntimos por decisión manipulada. Este veredicto o “decisión tipada” supone la resolución definitiva, clasificada y estandarizada que genera la plataforma al procesar cada petición.
La investigación ha arrojado una serie de conclusiones sobre la ineficacia de las medidas de protección estándar:
- Entrada estructurada ineficaz: el uso de formatos estructurados no protegió al modelo. Acciones como marcar un documento explícitamente como “no confiable” o segmentar la información en mensajes separados no redujeron la tasa de éxito de los ataques.
- Instrucciones de seguridad insuficientes: las directrices orientadas a que la IA ignore comandos maliciosos dentro de los documentos resultaron prácticamente inútiles, lo que apenas logró reducir los ataques exitosos de 18 a 17 sobre un total de 27.
- Ausencia de razonamiento: se ha observado en otros modelos que la capacidad de razonamiento es la defensa más sólida para elevar el coste de manipulación. Sin embargo, Jev no cuenta actualmente con un ajuste de razonamiento que se pueda activar.
El estudio concluye que, si bien el formato de salida de Jev limita la estructura de la respuesta, esto no ofrece protección alguna sobre la integridad del contenido de entrada. Aunque no se conoce con exactitud qué ocurre dentro del modelo, una arquitectura diferente no implica automáticamente un conjunto distinto de vulnerabilidades. Ante este escenario, Check Point AI Security Research recomienda a las empresas evaluar la seguridad del sistema en su conjunto y no solo la del modelo de IA de forma aislada. Asimismo, es fundamental aportar la mayor cantidad de evidencia posible en los procesos de decisión y establecer mecanismos para filtrar o examinar exhaustivamente las entradas de datos antes de que estas lleguen al modelo de decisión automatizada.