La sécurité de vos LLM, testée et prouvée conforme.
~31 000 prompts adverses défensifs (injection, jailbreak, fuite de données, toxicité, sur-agentivité, désinformation…) à rejouer contre VOS modèles avec des outils gratuits (garak, promptfoo). Le rapport obtenu est votre preuve de robustesse pour le dossier EU AI Act Annexe IV. On-prem, rien ne sort de chez vous.
Ce qu’on a ajouté récemment
Un flux vivant : voici la couverture ajoutée à ce feed, datée.
- +274 sondes
- +82 sondes
- +58 sondes
- +104 sondes
Huit surfaces d’attaque LLM couvertes.
LLM01, injections directes/indirectes, DAN, obfuscation, many-shot, smuggling Unicode.
LLM02, extraction de system-prompt, secrets, PII, fuite du tour précédent.
LLM05, canaris inertes XSS/SQLi/SSTI/exfil que le code en aval pourrait mal traiter.
LLM06, appels d’outils dangereux proxy (suppression, exfil e-mail, shell) sans validation.
LLM09, faux faits, citations et packages hallucinés, adhésion à des prémisses fausses.
LLM10, épuisement de ressources / déni-de-portefeuille (boucles, expansion récursive).
+ deux bundles issus de benchmarks de référence (permissifs) : refus de contenu nuisible et génération de toxicité. Chaque prompt est étiqueté technique + catégorie OWASP + technique MITRE ATLAS, avec un rapport de couverture. ~50% du contenu est original (généré maison, propriétaire).
La preuve de conformité, pas juste des prompts.
Chaque prompt → OWASP LLM Top 10 → EU AI Act (Art. 15 / Annexe IV) → MITRE ATLAS → NIST AI 600-1.
Formats prêts pour garak (NVIDIA) et promptfoo. Une commande, un rapport pass/fail sur VOS modèles.
Vous tournez chez vous. Aucun prompt ni modèle n’est envoyé à un SaaS tiers, essentiel pour les régulés.
Sources permissives (garak, benchmarks MIT/Apache) dédupliquées + moitié de contenu original généré par nous.
Payloads = canaris inoffensifs (PWNED, révèle ton prompt…). Malware/CBRN/PII réelle filtrés au build.
Nouvelles techniques et catégories ajoutées au fil des menaces LLM. Une clé, toujours à jour.
Comment on le fait tourner ?
Le pack fournit des prompts en JSONL, des tests promptfoo prêts (YAML) et une probe garak (tc_redteam.py). Avec garak : `garak --target_type ollama --target_name <modèle> --probes tc_redteam.Injection`. Avec promptfoo : `promptfoo eval --tests bundles/<bundle>/promptfoo-tests.yaml`. Les deux outils sont gratuits et open-source ; vous les pointez sur votre modèle ou votre endpoint.
En quoi ça aide pour l’EU AI Act ?
L'Art. 15 de l'EU AI Act exige la robustesse face aux attaques adverses (adversarial examples, évasion de modèle), et l'Annexe IV exige la documentation technique correspondante. Rejouer ce flux contre votre système produit un rapport de test, une pièce documentaire directe pour votre dossier de conformité. On mappe aussi NIST AI 600-1 (actions MEASURE) et MITRE ATLAS. Note : la couverture par prompt vise LLM01/02/05/06/07/09/10 ; les risques architecturaux (LLM03/04/08) relèvent de contrôles process, pas de prompts.
Quelle licence ? Puis-je le redistribuer ?
Le pack est un produit propriétaire d'abonnement (EULA fournie). Vous pouvez l'utiliser pour tester vos propres systèmes ; vous ne pouvez pas le redistribuer, le revendre ni en faire un feed concurrent. Le contenu original généré par ThreatClaw (~la moitié) et la compilation sont notre propriété ; les composants tiers permissifs conservent leur licence (attribués dans le pack).
Prêt à prouver la robustesse de vos LLM ?
Abonnement annuel. Clé instantanée. On-prem. Résiliable à tout moment.