Voz media US Voz.us

Anthropic revela que Claude se infiltró en sistemas reales durante pruebas de seguridad de IA

Según la compañía, se evaluaron más de 141.000 operaciones de prueba. En ese proceso, tres versiones distintas de Claude —incluido uno de sus modelos más potentes, Mythos 5— lograron acceder indebidamente a sistemas de tres organizaciones que no han sido identificadas.

El logo de Anthropic en un dispositivo-Imagen de Archivo

El logo de Anthropic en un dispositivo-Imagen de ArchivoAFP.

Carlos Dominguez
Publicado por

Anthropic reconoció este jueves que varios de sus modelos de inteligencia artificial lograron "acceso no autorizado" a sistemas de tres organizaciones durante pruebas de seguridad que, en teoría, debían mantenerlos aislados del mundo real.

El anuncio se produce apenas unos días después de que su rival OpenAI revelara que dos de sus agentes de IA salieron por iniciativa propia del entorno controlado en el que estaban siendo evaluados y atacaron la plataforma Hugging Face.

Qué ocurrió exactamente

Según la compañía, se evaluaron más de 141.000 operaciones de prueba. En ese proceso, tres versiones distintas de Claude —incluido uno de sus modelos más potentes, Mythos 5— lograron acceder indebidamente a sistemas de tres organizaciones que no han sido identificadas.

Según informó AFP, a diferencia del caso de OpenAI, Anthropic explicó que el acceso a internet se produjo por "un malentendido" con su socio de evaluación, la empresa Irregular. Una vez conectados, los modelos utilizaron técnicas básicas, como explotar contraseñas débiles y puntos de acceso sin autenticación.

Mythos 5, el modelo más avanzado involucrado, solo está disponible para un número limitado de socios previamente aprobados.

Anthropic afirmó que está analizando el incidente junto a Irregular y que ya se puso en contacto —o intentó hacerlo— con las tres organizaciones afectadas.

El precedente de OpenAI

El martes, OpenAI confirmó que sus modelos también vulneraron la seguridad de varias empresas. La compañía había admitido la semana pasada que algunos de sus agentes de IA escaparon del entorno confinado durante las pruebas, se conectaron a internet e infiltraron Hugging Face, una plataforma muy utilizada por desarrolladores para almacenar y compartir código.

Días después, OpenAI informó de tres incidentes adicionales. El consejero delegado de la empresa, Sam Altman, explicó en un pódcast esta semana que la compañía decidió pausar sus propias pruebas mientras refuerza la seguridad de sus entornos controlados.

​Ambos casos ponen de relieve un riesgo cada vez más evidente: a medida que los modelos de inteligencia artificial se vuelven más autónomos y capaces de actuar por sí mismos, las pruebas de seguridad también se complican. Lo que debería ser un entorno cerrado y controlado puede fallar, ya sea por errores de configuración o por la propia iniciativa de los sistemas.
tracking