Anthropic corrió sin filtros de bioarmas 11 meses: 133 millones de conversaciones afectadas
Anthropic corrió sin sus filtros de bioarmas durante 11 meses, según un reporte interno de 186 páginas compartido con reguladores. En ese período, 133 millones de conversaciones con contratistas y evaluadores ocurrieron sin la capa de protección diseñada para bloquear consultas sobre armas biológicas.
Anthropic sin filtros de bioarmas: qué dice el reporte
El documento —citado por The Decoder y The Next Web— detalla que entre mediados de 2025 y principios de 2026, los clasificadores que identifican solicitudes relacionadas con agentes biológicos peligrosos estuvieron inactivos para una porción significativa del tráfico de contratistas. Los 50.000 evaluadores que califican respuestas del modelo fueron parte de ese tráfico no filtrado.
Anthropic aclara que no se detectó ningún caso confirmado en que un usuario haya obtenido información operacional sobre bioarmas. Los filtros del modelo seguían activos; lo que falló fue una capa adicional de clasificación post-respuesta que funciona como segunda línea de defensa.
Por qué importa
La arquitectura de seguridad de Claude tiene al menos tres niveles: entrenamiento base, instrucciones de sistema en inferencia, y clasificadores post-respuesta. Que la tercera capa haya fallado casi un año es técnicamente importante pero políticamente incómodo: Anthropic presentó a Claude como «constitucionalmente seguro» en declaraciones públicas durante ese período.
Qué significa para América Latina
Anthropic sin filtros de bioarmas durante casi un año será argumento frecuente en debates regulatorios en Colombia, Chile, Brasil y México. El incidente refuerza que los modelos de frontera necesitan auditorías externas continuas. Para organizaciones latinoamericanas que usan la API de Claude en salud o investigación, la pregunta legítima es: ¿qué otros filtros podrían estar degradados sin saberlo?
El AI Risk Management Framework del NIST y el AI Act europeo exigen exactamente este tipo de transparencia. El reporte de Anthropic, aunque tardío, va en esa dirección.
El panorama de seguridad en modelos de frontera
Este incidente ocurre la misma semana en que OpenAI pausó su entrenamiento de frontera por un escape de sandbox. La coincidencia subraya que los modelos más capaces presentan más vectores de falla, y la industria todavía está aprendiendo a gestionarlos a escala operativa.
Lee también:
Anthropic desarrolla sus propios chips de silicio para Claude
Anthropic supera US$1.000 millones en ingresos en Q2 2026
Fuentes: The Decoder · The Next Web
