Ciberseguridad

Anthropic lanza Claude Fable pero bloquea a quienes más lo necesitan

Anthropic lanzó Claude Fable con guardrails que bloquean a científicos y expertos en ciberseguridad. La paradoja de la IA más segura del mundo.

Anuncios

El 9 de junio de 2026, Anthropic lanzó dos modelos de IA que marcan un antes y después en la industria. Pero la noticia no está solo en lo que hacen, sino en lo que no dejan hacer.

Claude Fable 5, la versión pública, incluye guardrails que bloquean consultas sobre ciberseguridad, biología y química. El problema: esos son exactamente los temas que investigadores y expertos necesitan explorar para hacer su trabajo.

La paradoja es evidente. Anthropic diseñó Fable 5 como la versión “segura” de Claude Mythos 5.1, su modelo más avanzado, reservado para socios de Project Glasswing y un grupo selecto de investigadores en biología.

Cuando un usuario pregunta sobre vulnerabilidades, armas biológicas o química, Fable 5 no responde. La consulta se redirige a Claude Opus 4.8, un modelo anterior y significativamente menos capaz. La diferencia es abismal: Mythos 5 obtuvo un 78% en ExploitBench, mientras que Opus 4.8 apenas alcanzó el 40%.

El inmunólogo Derya Unutmaz, del Jackson Laboratory, lo vivió en carne propia. Su investigación requiere analizar modelos de IA para entender mecanismos inmunológicos, pero Fable 5 le bloquea el acceso sin distinción. No es un caso aislado. La experta en ciberseguridad Valentina “Chompie” Palmiotti, de IBM X-Force, también criticó las restricciones públicamente, al igual que el investigador Matt Suiche. Su argumento es consistente: los guardrails no diferencian entre un investigador legítimo y un actor malintencionado. El resultado es que los buenos quedan fuera mientras los malos buscan otros caminos.

Anthropic es consciente de la fricción. Diane Penn, head of product de la compañía, declaró a WIRED que el mecanismo está configurado para pecar de precavido. “Estamos intentando hacer mejoras de forma beneficiosa, incluso si no tenemos la solución perfecta para cada caso de uso desde el principio”, dijo.

La empresa asegura que en más de mil horas de pruebas de red-teaming no encontraron jailbreaks universales, pero el costo es evidente: muchos usuarios legítimos quedan excluidos.

El precio refuerza la exclusividad. Fable 5 cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida, el doble que los modelos anteriores de Anthropic.

La compañía también implementó detección de destilación: si sospecha que alguien intenta entrenar un modelo más pequeño a partir de Fable 5, redirige esas consultas a Opus 4.8.

Aquí surge la pregunta incómoda: ¿a quién protegen realmente estos guardrails? Los cibercriminales no usan APIs oficiales con sistemas de monitoreo. Explotan modelos abiertos, vulnerabilidades conocidas y técnicas que no necesitan el permiso de Anthropic. Mientras tanto, los investigadores de seguridad —los mismos que podrían encontrar y reportar fallos a tiempo— tienen las manos atadas.

La historia de Fable 5 y Mythos 5.1 no es solo un hito técnico. Es una decisión sobre quién decide qué puedes hacer con la IA más avanzada del mundo. Y por ahora, la respuesta de Anthropic es clara: casi nadie.

Avatar photo
Sobre el autor

Julio Del Angel

Redactor en Facialix

Ingeniero en Sistemas, egresado del Instituto Tecnológico Superior de Pánuco (TecNM), Veracruz. Especializado en desarrollo de software, tecnología e inteligencia artificial. Fundador y editor de Facialix, donde analiza noticias, avances científicos y oportunidades educativas.

Ver todos sus artículos →

Deja un comentario