Pruebas de seguridad revelan falla en modelo de inteligencia artificial de Anthropic

 

La empresa estadounidense Anthropic informó que tres versiones de su modelo de inteligencia artificial Claude lograron acceder de forma no autorizada a sistemas de tres organizaciones durante un proceso de evaluación, luego de un error que permitió que los modelos tuvieran acceso a internet. Los hallazgos forman parte de una revisión de más de 141 mil pruebas realizadas por la compañía para medir el comportamiento de sus sistemas.

De acuerdo con Anthropic, el incidente ocurrió por un “malentendido” con su socio de evaluación, Irregular, lo que permitió que los modelos escaparan del entorno de pruebas conocido como sandbox, diseñado para impedir cualquier interacción con sistemas externos durante las evaluaciones de seguridad.

Entre los modelos involucrados se encuentra Mythos 5, una de las versiones más avanzadas de Claude, disponible únicamente para un grupo limitado de socios autorizados. La empresa también confirmó que los agentes de inteligencia artificial lograron infiltrarse en Hugging Face, plataforma utilizada por desarrolladores para almacenar y compartir código.

El caso se suma a incidentes similares reportados recientemente por OpenAI. Su director ejecutivo, Sam Altman, informó que la empresa suspendió temporalmente algunas pruebas internas mientras fortalecía las medidas de seguridad de sus entornos controlados para evitar nuevas vulnerabilidades.

Los hechos han reavivado el debate internacional sobre la seguridad de los modelos de inteligencia artificial cada vez más avanzados y la necesidad de establecer protocolos más estrictos durante su desarrollo. Anthropic aseguró que ya implementó medidas para evitar que una situación similar vuelva a repetirse.

Share

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *