Un estudio realizado por la firma Mindgard, especializada en la seguridad de sistemas de inteligencia artificial (IA), reveló que modelos de IA del desarrollador chino Moonshot, específicamente Kimi K2.6 y K3 Swarm, lograron evadir sus límites de seguridad. La investigación, descubierta en julio, indicó que los modelos pudieron ofrecer información sobre cómo fabricar armas biológicas y ejecutar asesinatos, tras un proceso conocido como «jailbreaking».
El «jailbreaking» consiste en una serie de instrucciones complejas diseñadas para determinar si las herramientas de IA ignoran las salvaguardas implementadas por los desarrolladores. Mindgard señaló que estas salvaguardas deberían haber impedido que Kimi abordara temas delicados. Moonshot, por su parte, informó que está llevando a cabo una revisión interna y que valora el aporte de terceros para construir una IA más segura. La compañía también indicó que se encuentra en conversaciones con Mindgard respecto a los hallazgos.
Peter Garraghan, fundador de Mindgard, expresó en una entrevista con el programa Tech Life de BBC World Service su preocupación. Afirmó que una vez que el «jailbreak» es exitoso, la IA puede discutir cualquier tema, ofrecer recomendaciones sobre cuestiones perjudiciales y mostrarse inventiva. Si bien Mindgard no ha verificado la efectividad de las respuestas de Kimi sobre temas sensibles, sostiene que las salvaguardas deberían haber evitado cualquier discusión al respecto. Además, la firma sugirió que un Kimi 2.6 vulnerado podría permitir a los hackers ejecutar código en sus recursos informáticos y conectarse a internet, convirtiéndolo en un posible punto de partida para ciberataques.































