ThreatClaw es un agente de ciberseguridad open source escrito en Rust, con una sandbox aislada firmada, 5 pilares de seguridad compilados en el binario y una cobertura auto-evaluada 9/9 frente al OWASP ASI 2026 (sin auditoría externa por ahora).
No es una elección estética. Rust elimina en tiempo de compilación categorías enteras de vulnerabilidades que representan el 70% de los CVEs críticos en software de sistema.
Imposible por construcción, el compilador rechaza todo acceso a memoria fuera de límites
El borrow checker lo prohíbe en compilación, sin necesidad de garbage collector
La concurrencia es segura por defecto, el sistema de tipos garantiza acceso exclusivo
El tipo Option<T> obliga al manejo explícito de la ausencia de valor
Cada skill se ejecuta en una sandbox aislada con:
Límite de CPU por ejecución, imposible saturar el sistema
Una skill declara lo que necesita (red, filesystem, secretos). Por defecto: nada. network=false significa que una skill comprometida no puede exfiltrar datos
Cada salida de la sandbox se escanea antes de salir del entorno aislado. Si una credencial se filtra en una respuesta, se bloquea
Cada skill está firmada. Un archivo modificado no se carga
Lo que diferencia a ThreatClaw de todos los demás agentes:
AGENT_SOUL.toml verificado por huella SHA-256 compilada en el binario Rust. Bloqueado en runtime, toda alteración en caliente activa el kill switch. Código open source: un operador puede recompilar un Soul personalizado, pero es un acto deliberado, auditable y que cambia la huella.
44+ comandos prevalidados, definidos en Rust, no modificables por el LLM. Cada comando tiene: nivel de riesgo, reversibilidad, objetivos prohibidos (root, threatclaw mismo). Cero shell arbitrario.
Cada salida de herramienta se envuelve antes de llegar al LLM. 25+ patrones de inyección específicos de ciberseguridad detectados y bloqueados ("ignore previous instructions", "mark as false positive", etc.). Los datos permanecen como datos, nunca como órdenes.
Cada entrada en memoria conversacional firmada está protegida por firma criptográfica. Las herramientas solo pueden leer, nunca escribir. Cualquier modificación externa se detecta en el siguiente ciclo.
8 triggers de parada automática: intento fuera de whitelist, modificación del soul, ataque a sus propios contenedores, timeout de autonomía, anomalía de comportamiento, activación manual CISO. Al activarse: parada atómica + snapshot forense + alerta Slack inmediata.
Antes de cada llamada al LLM en la nube anonimizado, todos los datos pasan por el anonimizador:
Cada acción del agente se registra en PostgreSQL con:
Forense completo en caso de incidente. Evidencia de auditoría NIS2.
| # | Riesgo | Status | Cómo |
|---|---|---|---|
| ASI01 | Goal Hijacking | ✓ | Soul + XML wrapper |
| ASI02 | Tool Misuse | ✓ | Whitelist 44+ cmd |
| ASI03 | Identity & Privilege | ✓ | HITL + auditoría firmada |
| ASI04 | Supply Chain | ✓ | Sandbox aislada firmada |
| ASI05 | Code Execution | ✓ | Sandbox fuel-metered |
| ASI06 | Memory Poisoning | ✓ | Firma criptográfica + read-only |
| ASI07 | Inter-Agent | N/A | N/A, agente único V1 |
| ASI08 | Cascading Failures | ✓ | Kill switch + timeout |
| ASI09 | Excessive Trust | ✓ | Doble confirmación High/Critical |
| ASI10 | Rogue Agent | ✓ | Kill switch 8 triggers |
Auditoría cargo audit del 21 de marzo de 2026. 10 CVEs identificadas, todas parcheadas o eliminadas.