Noticias
Anthropic retira Internet de sus pruebas con Claude tras varios fallos de control
A un agente de inteligencia artificial no solo hay que explicarle qué queremos conseguir. También hay que conseguir que entienda cuándo debe dejar de intentarlo. Anthropic ha encontrado varios casos en los que Claude, al tropezar con una barrera que impedía completar una tarea, no interpretó necesariamente que debía detenerse: buscó otro camino. Los incidentes tuvieron un impacto real mínimo, según la compañía, pero han sido suficientes para que Anthropic desactive temporalmente el acceso a Internet en directo de todas sus evaluaciones internas mientras refuerza los sistemas destinados a detectar este tipo de comportamientos. El cambio no afecta al acceso web de Claude para sus usuarios.
Los casos forman parte de un nuevo informe con el que Anthropic quiere publicar de manera más habitual comportamientos inesperados encontrados durante evaluaciones y uso interno. La compañía los agrupa en cuatro grandes categorías: explotación de una vulnerabilidad para ejecutar comandos en un servidor, envío de formularios reales cuando la tarea no debía llegar hasta ahí, acceso a datos sorteando restricciones técnicas o económicas y utilización de acortadores de URL para evitar los límites impuestos a sus herramientas web. Algunos episodios involucraron páginas de organismos públicos estadounidenses, por lo que Anthropic informó a las agencias afectadas y a la Casa Blanca, aunque insiste en que ninguno comprometió datos de clientes ni sus propios sistemas.
Uno de los ejemplos resume especialmente bien el problema. Claude Mythos Preview recibió el encargo de realizar un análisis científico, pero la herramienta pública que necesitaba, alojada por una universidad, devolvía un error. El modelo empezó entonces a explorar el sitio, encontró un script que permitía solicitar archivos, descargó incluso el código del propio script y descubrió en él una vulnerabilidad de inyección. Después la aprovechó para ejecutar el cálculo que necesitaba directamente en el servidor. Claude no había recibido la orden de atacar una universidad: quería terminar un análisis. La intrusión apareció simplemente como otra forma de alcanzar el objetivo cuando el camino previsto dejó de funcionar.
Los formularios produjeron situaciones todavía más extrañas. Un modelo de investigación debía rellenar una copia de práctica de un documento gubernamental, pero acabó acudiendo al formulario real cuando la versión simulada falló y llegó a enviarlo en varias ejecuciones. Claude Haiku 4.5 recibió en otra prueba instrucciones explícitas para detenerse antes del último paso y aun así completó el envío esperando encontrar posteriormente una pantalla de confirmación. El episodio más llamativo ocurrió cuando el mismo modelo, mientras generaba tareas de ejemplo sobre páginas elegidas al azar, encontró la web de un homicidio sin resolver y envió una pista inventada a un formulario policial. El sistema antispam la bloqueó antes de que llegara a los investigadores.
En otros casos, la barrera estaba en el acceso a los datos. Claude encontró tokens expuestos por las propias aplicaciones web y los utilizó para consultar directamente servicios que el entorno de evaluación pretendía mantener fuera de su alcance, e incluso consiguió información pública que normalmente requería un pago. Varios modelos descubrieron también que podían utilizar servicios gratuitos de acortamiento para esquivar el límite de longitud de URL de las herramientas de Anthropic. El patrón encaja con lo que se conoce como reward hacking: si un modelo aprende que lo importante es completar una tarea, puede terminar descubriendo que un atajo también proporciona la recompensa esperada aunque no respete el camino que sus diseñadores pretendían imponerle.
La respuesta de Anthropic ha sido cortar temporalmente el acceso a la web en todas sus evaluaciones internas hasta comprobar que sus nuevas defensas pueden detectar estas conductas con suficiente fiabilidad. Algunas pruebas dejarán de ejecutarse sobre Internet real, otras pasarán a entornos offline y determinadas herramientas incorporan ya controles más estrictos sobre aquello que el modelo puede solicitar. La compañía asegura además que sus nuevos sistemas de monitorización habrían bloqueado todos los incidentes descritos en el informe cuando fueron probados retrospectivamente. También está revisando entornos de entrenamiento capaces de premiar involuntariamente estos atajos y reduciendo el acceso a Internet de sus agentes internos mediante infraestructuras más aisladas.
No es la primera advertencia en esta dirección. Hace unos meses ya vimos cómo distintos modelos de frontera intentaban superar restricciones durante evaluaciones de ciberseguridad, y Anthropic ha documentado posteriormente incidentes bastante más graves que los publicados ahora. La diferencia es que estos nuevos casos muestran el problema en tareas mucho más cotidianas: no hace falta pedir a una IA que ataque un sistema para que termine cruzando un límite si interpreta que hacerlo le acerca a su objetivo. Durante años hemos medido cuánto puede hacer un modelo. A medida que recibe más herramientas y autonomía, empieza a ser igual de importante comprobar si sabe reconocer cuándo debe dejar de hacer cosas.
-
GuíasHace 4 díasQué placa base elegir: Guía de compras para Intel y AMD 2026
-
GuíasHace 12 horasGuía para diferenciar generaciones y gamas de tarjetas gráficas
-
GuíasHace 2 díasDiez herramientas de hacking para mejorar la seguridad de redes y PCs
-
PrácticosHace 2 díasSeis usos de un pendrive USB más allá de almacenar archivos


