La seguridad de sus LLM, probada y conforme.
~31.000 prompts adversarios defensivos (inyección, jailbreak, fuga de datos, toxicidad, agencia excesiva, desinformación…) para ejecutar contra SUS modelos con herramientas gratuitas (garak, promptfoo). El informe resultante es su evidencia de robustez para el Anexo IV del EU AI Act. On-prem, nada sale de su infraestructura.
What we added recently
A living feed: here is the coverage added to it, dated.
- +274 sondes
- +82 sondes
- +58 sondes
- +104 sondes
Ocho superficies de ataque LLM cubiertas.
LLM01, inyecciones directas/indirectas, DAN, ofuscación, many-shot, smuggling Unicode.
LLM02, extracción de system-prompt, secretos, PII, fuga del turno anterior.
LLM05, canarios inertes XSS/SQLi/SSTI/exfil que el código posterior podría manejar mal.
LLM06, llamadas proxy a herramientas peligrosas (borrado, exfil email, shell) sin aprobación.
LLM09, hechos falsos, citas/paquetes alucinados, adhesión a premisas falsas.
LLM10, agotamiento de recursos / denegación de billetera (bucles, expansión recursiva).
+ dos bundles de benchmarks de referencia (permisivos): rechazo de contenido dañino y generación de toxicidad. Cada prompt está etiquetado con su técnica + categoría OWASP + técnica MITRE ATLAS, con un informe de cobertura. ~50% del contenido es original (propio).
Evidencia de conformidad, no solo prompts.
Cada prompt → OWASP LLM Top 10 → EU AI Act (Art. 15 / Anexo IV) → MITRE ATLAS → NIST AI 600-1.
Formatos listos para garak (NVIDIA) y promptfoo. Un comando, un informe pass/fail sobre SUS modelos.
Lo ejecuta internamente. Ningún prompt ni modelo se envía a un SaaS externo, esencial para regulados.
Fuentes permisivas (garak, benchmarks MIT/Apache) deduplicadas + mitad de contenido original nuestro.
Payloads = canarios inofensivos (PWNED, revela tu prompt…). Malware/CBRN/PII real filtrado en el build.
Nuevas técnicas y categorías añadidas según evolucionan las amenazas LLM. Una clave, siempre al día.
¿Cómo se ejecuta?
El pack incluye prompts en JSONL, tests promptfoo listos (YAML) y una probe garak (tc_redteam.py). Con garak: `garak --target_type ollama --target_name <modelo> --probes tc_redteam.Injection`. Con promptfoo: `promptfoo eval --tests bundles/<bundle>/promptfoo-tests.yaml`. Ambas herramientas son gratuitas y open-source; apúntalas a tu modelo o endpoint.
¿Cómo ayuda con el EU AI Act?
El Art. 15 del EU AI Act exige robustez frente a ataques adversarios (adversarial examples, evasión de modelo), y el Anexo IV exige la documentación técnica correspondiente. Reejecutar este feed contra su sistema produce un informe de prueba, una pieza documental directa para su expediente. También mapeamos NIST AI 600-1 (acciones MEASURE) y MITRE ATLAS. Nota: la cobertura por prompt cubre LLM01/02/05/06/07/09/10; los riesgos arquitectónicos (LLM03/04/08) son controles de proceso.
¿Qué licencia? ¿Puedo redistribuirlo?
El pack es un producto propietario de suscripción (EULA incluida). Puede usarlo para probar sus propios sistemas; no puede redistribuirlo, revenderlo ni crear un feed competidor. El contenido original generado por ThreatClaw (~la mitad) y la compilación son nuestra propiedad; los componentes de terceros permisivos conservan su licencia (atribuidos en el pack).
¿Listo para probar la robustez de sus LLM?
Suscripción anual. Clave instantánea. On-prem. Cancela cuando quieras.