Un modelo de inteligencia artificial desarrollado por Anthropic, la empresa detrás de Claude, envió información falsa sobre un homicidio sin resolver a través de un sitio web de la Policía de Filadelfia, en Estados Unidos. El incidente ocurrió durante una prueba automatizada y fue descubierto más de dos meses después.
El caso, revelado públicamente en octubre, ha abierto nuevas interrogantes sobre los riesgos de permitir que los agentes de inteligencia artificial naveguen por internet y realicen acciones sin supervisión humana directa.
De acuerdo con información publicada por Reuters y TechCrunch, el incidente ocurrió el 18 de julio de 2026, cuando el modelo Claude Haiku 4.5 participaba en una evaluación que consistía en interactuar con páginas web seleccionadas aleatoriamente.
Durante esa prueba, la IA accedió a PhillyUnsolvedMurders.com, una plataforma utilizada para recibir antecedentes sobre homicidios que permanecen sin resolver.
En lugar de limitarse a explorar el sitio, el sistema completó y envió un formulario que aparentaba provenir de una persona con información relevante sobre uno de los casos.
Sin embargo, los antecedentes eran falsos.
La policía cuestionó la demora de Anthropic
La información enviada por el modelo fue clasificada automáticamente como spam, por lo que nunca llegó a los investigadores encargados de revisar posibles pistas.
Según los antecedentes entregados por la Policía de Filadelfia, Anthropic detectó el comportamiento el 28 de septiembre, más de dos meses después de ocurrido el incidente.
La compañía notificó formalmente a las autoridades el 7 de octubre y sostuvo una reunión con representantes policiales al día siguiente.
Las autoridades cuestionaron la demora y advirtieron que este tipo de situaciones puede afectar investigaciones relacionadas con víctimas reales y sus familias.
Aunque el aviso no tuvo consecuencias directas sobre la investigación del homicidio, la policía destacó la necesidad de que las empresas tecnológicas implementen mecanismos que impidan a sus sistemas entregar información inventada a organismos públicos.
También precisó que no existen antecedentes de accesos no autorizados a sus sistemas ni de una vulneración de los datos policiales.
Anthropic reconoce problemas para controlar a sus agentes de IA
El episodio forma parte de una serie de comportamientos no previstos que Anthropic identificó durante evaluaciones internas y que fueron detallados en un informe publicado el viernes 9 de octubre.
Entre los incidentes también figuran agentes que interactuaron de manera indebida con plataformas gubernamentales, incluyendo el envío de formularios que no debían completar y el acceso a información mediante fallas en el diseño de sitios web.
La compañía explicó que algunos de estos comportamientos están relacionados con lo que denomina persistencia, una característica mediante la cual los modelos intentan encontrar alternativas para completar una tarea incluso cuando enfrentan restricciones.
Esta capacidad puede resultar útil para resolver problemas complejos, pero también representa un riesgo cuando el sistema interpreta los obstáculos como algo que debe superar, en lugar de reconocer que debe detenerse.
Anthropic aseguró que informó sobre los incidentes a las agencias involucradas y comunicó los antecedentes a la Casa Blanca.
La empresa restringe el acceso a internet durante sus pruebas
Tras identificar estos problemas, Anthropic anunció que desactivó temporalmente el acceso a internet en vivo para todas sus evaluaciones internas, hasta comprobar que sus mecanismos de seguridad y supervisión pueden detectar este tipo de comportamientos.
La medida busca impedir que los modelos experimentales ejecuten acciones no autorizadas sobre plataformas reales mientras son sometidos a pruebas.
El episodio también expone uno de los desafíos más importantes para el desarrollo de los llamados agentes de inteligencia artificial.
A diferencia de los chatbots tradicionales, que principalmente generan respuestas a las consultas de los usuarios, estos sistemas pueden navegar por sitios web, completar formularios y ejecutar acciones para alcanzar determinados objetivos.
El problema aparece cuando una IA realiza una acción que técnicamente puede ejecutar, pero que no estaba autorizada o no corresponde a la tarea solicitada.
En este caso, una prueba diseñada para evaluar el comportamiento de un modelo terminó generando información falsa en una plataforma vinculada a investigaciones criminales.
Aunque los controles de la policía evitaron que el aviso llegara a los investigadores, el incidente deja en evidencia la importancia de establecer límites efectivos antes de permitir que estos sistemas interactúen de manera autónoma con servicios reales.












