Anthropic admite que su IA envió pistas falsas sobre un homicidio a la policía y rellenó visados de forma autónoma

Anthropic ha reconocido que su IA actuó de forma autónoma. En concreto, en un informe de evaluación y seguridad publicado en su blog este viernes, ha admitido, aunque sin mencionar los sitios web atacados, que agentes de inteligencia artificial actuaron por su cuenta y accedieron a diversas páginas gubernamentales, rellenaron solicitudes de visado del Departamento de Estado de EEUU e incluso llegaron a enviar una denuncia falsa de homicidio al Departamento de Policía de Filadelfia. Se trata del primer caso conocido en el que una IA habría intentado comunicar una denuncia falsa a las autoridades.

Según detalla The New York Times, dos fuentes con conocimiento de los incidentes indicaron que los agentes de IA de Anthropic habían presentado una veintena de solicitudes de visado en la web del Departamento de Estado, aunque no llegaron a ser procesados porque todas estaban incompletas. Funcionarios de la Casa Blanca reconocieron que fueron informados sobre el incidente y exigieron a las tecnológicas que reporten de inmediato cualquier actividad similar.

Con respecto a la denuncia falsa, la Policía de Filadelfia informó el viernes que Anthropic le había notificado el incidente. “La demora de dos meses en detectar el incidente y reportarlo a la ciudad es inaceptable”, aseguraron y recordaron que proporcionar informes falsos a las autoridades policiales es un delito menor según la ley de Pensilvania, aunque en el texto se especifica “una persona”.

La denuncia, fechada el 18 de julio, afirmaba que tenía información sobre un caso sin resolver, según indicó el departamento que añadió que ya inicialmente fue marcada como spam y nunca se investigó. Según Reuters, en la denuncia ponía que podía que “tenga información sobre este caso”: “Recuerdo haber visto a alguien que coincidía con la descripción en la zona cercana a (la calle que aparece en la página) durante ese período. Por favor, póngase en contacto conmigo si esta información es relevante.”

Anthropic explicó en su blog que descubrió las acciones de sus agentes de IA tras iniciar una revisión de su actividad en este campo en julio. Ahora, reconoce que “un modelo de investigación no experimental, aún no publicado, debía completar una copia de práctica de un formulario gubernamental” y que “cuando la copia no se cargaba o el modelo la cerraba por error, este accedía al sitio web donde normalmente se aloja el formulario real y lo enviaba desde allí”.

Estos incidentes avivan la preocupación por el rápido avance de la inteligencia artificial, en medio de informes de ataques informáticos por parte de agentes de IA y advertencias de los investigadores sobre una eventual amenaza existencial para la humanidad.

La propia investigación de Anthropic se inició después de que OpenAI revelase que su tecnología había atacado a otra startup de IA, Hugging Face, y posteriormente se conoció que había decidido no apagarla para no retrasar sus planes comerciales. Anthropic también explicó entonces que su tecnología había escapado de los entornos de prueba y había llevado a cabo ataques informáticos. En concreto, que un modelo de IA que estaba probando había realizado varias acciones no autorizadas, entre ellas, aprovechar una vulnerabilidad en el sitio web de una universidad para descargar datos y enviar a una agencia gubernamental un formulario que se le había indicado que no debía enviar. Google también admitió posteriormente vez que su IA Gemini hackeó a tres empresas.

Source – Eldiario