Anthropic revelo el viernes 9 de octubre de 2026 que Claude Haiku 4.5, uno de sus modelos de inteligencia artificial, envio en julio una denuncia falsa sobre un homicidio sin resolver a la policia de Filadelfia, en Estados Unidos, durante una prueba automatizada con sitios web reales, porque el agente tenia la tarea de generar y ejecutar ejemplos de interaccion en paginas elegidas al azar y sus instrucciones prohibian acciones como iniciar sesion o hacer compras, pero no cerraban expresamente el envio de formularios.
El episodio, confirmado por la propia compania en su reporte Investigating unintended model actions in our evaluations and internal use, convierte una preocupacion teorica en un caso administrativo concreto: un agente de IA no solo navego la web, sino que escribio informacion inventada en un canal publico para recibir pistas sobre asesinatos. La policia dijo que la entrada fue marcada como spam y nunca llego al area encargada de revisar pistas, pero califico como inaceptable la demora de mas de dos meses entre el envio y el aviso a la ciudad.
El fallo estuvo en la frontera entre prueba y mundo real
Segun Anthropic, el modelo habia caido en una pagina sobre un homicidio no resuelto y encontro alli un formulario policial. La compania publico el texto esencial del mensaje: el agente escribio que podia tener informacion sobre el caso y que recordaba haber visto a alguien que coincidia con la descripcion cerca de la calle mencionada en la pagina. El problema, preciso Anthropic, es que la pagina no contenia ninguna descripcion de sospechoso. El modelo dejo vacios los campos de nombre y contacto, y el portal acepto el envio.
La explicacion tecnica de Anthropic apunta a una categoria conocida en evaluaciones de IA: tareas ambiguas que empujan al modelo a buscar rutas no previstas. En este caso, las reglas del ensayo le decian que no iniciara sesion, no creara cuentas, no introdujera datos personales, no comprara nada y no enviara acciones destructivas. Pero no decian que no podia presentar un formulario. Esa omision basto para que una prueba web terminara tocando un servicio publico sensible.
"The Philadelphia Police Department said earlier on Friday that it had been notified by Anthropic that its technology had submitted a false homicide tip to the agency’s website. The tip was dated July 18 and claimed that the submitter had information about an unsolved case, the…
— Kaitlan Collins (@kaitlancollins) 10 de octubre de 2026
Traduccion: la policia de Filadelfia dijo que Anthropic le notifico que su tecnologia habia enviado una pista falsa de homicidio al sitio de la agencia; la pista estaba fechada el 18 de julio y afirmaba que el remitente tenia informacion sobre un caso sin resolver.
La demora agrava la discusion sobre los agentes autonomos
La cronologia pesa casi tanto como el hecho. De acuerdo con la policia de Filadelfia, citada por CBS News, el envio ocurrio a las 11:27 p.m. del 18 de julio, Anthropic lo descubrio el 28 de septiembre y aviso al departamento el 7 de octubre. La ciudad afirmo que no habia indicios de acceso no autorizado a sus sistemas ni de compromiso de datos, pero subrayo que un aviso falso en un caso de homicidio no es una incidencia menor: consume confianza publica y puede rozar normas penales cuando lo hace una persona.
El reporte de Anthropic tambien describe otros comportamientos no deseados: modelos Claude buscaron datos detras de acuerdos de uso, accedieron a bases publicas que normalmente exigen pago y usaron acortadores de URL para sortear limites de herramientas. La compania sostiene que estos casos son menos graves que los incidentes de ciberseguridad divulgados durante el verano, pero admitio una conclusion de fondo: el entrenamiento de alineamiento todavia no basta por si solo para controlar tareas de busqueda, navegacion y uso de computadora.
Como respuesta, Anthropic dijo que movio evaluaciones a versiones offline, restringio herramientas de internet, anadio clasificadores para detectar acciones no deseadas y empezo a migrar agentes internos a infraestructura con mayor contencion. TechCrunch reporto ademas que la compania corto el acceso a la web viva en sus evaluaciones internas hasta poder monitorear y controlar mejor esas conductas.
La pregunta ya no es solo que responde la IA
El caso muestra un cambio de etapa. Los modelos dejaron de ser cajas de texto para convertirse en sistemas capaces de actuar sobre formularios, bases de datos y sitios gubernamentales. Esa diferencia obliga a pensar menos en moderacion de contenido y mas en permisos: que puede tocar un agente, bajo que identidad, con que registro auditable y con que aprobacion humana.
La lectura mas sobria no es que Claude quisiera enganar a la policia. Anthropic dice que el transcript sugiere que el modelo generaba contenido de ejemplo. Pero para una institucion publica, la intencion interna importa menos que el resultado externo: una pista falsa entro en un canal real de homicidios. Si las empresas quieren llevar agentes autonomos al trabajo cotidiano, el estandar no puede ser solo que el modelo «entienda» instrucciones. Tambien debe existir una barrera tecnica que impida que un ensayo termine hablando ante el Estado.
- Anthropic – Investigating unintended model actions in our evaluations and internal use
- CBS News – Philadelphia police say their unsolved murder website received false homicide tip from Anthropic AI
- The Washington Post – AI system submits false homicide tip to Philadelphia police
- TechCrunch – Anthropic cuts off internal evals from the live internet