Estaba hackeando mi propio sistema cuando Claude me frenó

Usé Claude Fable 5 para hackear mi propio sistema. El modelo me frenó a mitad. Sobre la frontera fina entre seguridad defensiva y ataque malicioso.

En este artículo

Sobre la frontera fina entre red-team defensivo y ataque malicioso — y por qué respeto que Claude Fable 5 se equivoque del lado prudente.

TL;DR — Usé Claude Fable 5 (el modelo más potente de Anthropic) como agente adversarial contra mi propio sistema financiero para una ONG de rescate animal. A mitad del trabajo, sus filtros de seguridad leyeron mi red-team defensivo como ataque ofensivo y me cambiaron de modelo automáticamente. La lección: seguridad defensiva legítima y ataque malicioso se escriben casi igual; los LLMs de frontera no pueden distinguir intención sin contexto, y prefiero filtros amplios que flojos en modelos de este poder.

El setup: red-team dentro del propio Claude

Uso Claude Fable 5 — el modelo más potente de Anthropic disponible para todos, no el que le preguntas qué cocinar — para auditar la seguridad de un sistema financiero que estoy construyendo para mi ONG de rescate animal. La meta es que cada peso donado sea 100% rastreable.

Mi forma de blindarlo antes de producción: monto un equipo adversarial dentro del propio Claude. Un agente escribe el código; otro hace de atacante — intenta romperlo, borrar registros, falsear saldos, sacar plata por huecos. Un red team contra mi propio sistema. La forma más honesta de saber si aguanta es que alguien de tu nivel intente tumbarlo.

El frenazo

A mitad de ese trabajo, Fable 5 marcó mi mensaje y me cambió solo a otro modelo. Sus filtros de seguridad — intencionalmente amplios — leyeron mi ciberseguridad defensiva como si fuera ofensiva.

Es el peaje de estar temprano en la curva, y respeto la decisión: prefiero filtros amplios que flojos cuando hablamos de modelos de este poder.

La frontera fina

Lo interesante es la frontera que revela: seguridad defensiva legítima y ataque malicioso se escriben casi igual.

“Borré una donación del ledger para comprobar que el sistema no lo permitiera” y “borré una donación del ledger” son la misma frase — hasta que conoces la intención.

Un LLM sin contexto no puede distinguir. Y en modelos de frontera, donde el costo de un falso negativo (dejar pasar un ataque real) es enorme, el trade-off correcto es el falso positivo (bloquear un red-team legítimo). Sale más caro dejar pasar que bloquear en exceso.

La pregunta que te dejo

A los que empujan estas herramientas en trabajo serio de seguridad o de código: ¿les ha pasado? ¿Aplicaron al programa de verificación de Anthropic, reformularon el prompt, cambiaron de modelo?

Me interesa cómo lo están manejando.

Vladislav Marinovich

AI & Data Engineer en Bogotá. Construyo sistemas de datos e IA que se pueden auditar, no solo usar. Escribo sobre decisiones reales — con los números, los errores y las alternativas que descarté.