La sicurezza dei vostri LLM, testata e conforme.
~31.000 prompt avversariali difensivi (injection, jailbreak, fuga di dati, tossicità, excessive agency, disinformazione…) da rieseguire contro i VOSTRI modelli con strumenti gratuiti (garak, promptfoo). Il report ottenuto è la vostra prova di robustezza per il fascicolo EU AI Act Allegato IV. On-prem, nulla esce dalla vostra infrastruttura.
What we added recently
A living feed: here is the coverage added to it, dated.
- +274 sondes
- +82 sondes
- +58 sondes
- +104 sondes
Otto superfici di attacco LLM coperte.
LLM01, injection dirette/indirette, DAN, offuscamento, many-shot, smuggling Unicode.
LLM02, estrazione system-prompt, segreti, PII, leak del turno precedente.
LLM05, canary inerti XSS/SQLi/SSTI/exfil che il codice a valle potrebbe gestire male.
LLM06, chiamate proxy a strumenti pericolosi (cancellazione, exfil email, shell) senza approvazione.
LLM09, fatti falsi, citazioni/pacchetti allucinati, adesione a premesse false.
LLM10, esaurimento risorse / denial-of-wallet (loop, espansione ricorsiva).
+ due bundle da benchmark di riferimento (permissivi): rifiuto di contenuti dannosi e generazione di tossicità. Ogni prompt è etichettato con tecnica + categoria OWASP + tecnica MITRE ATLAS, con report di copertura. ~50% del contenuto è originale (proprietario).
Prova di conformità, non solo prompt.
Ogni prompt → OWASP LLM Top 10 → EU AI Act (Art. 15 / Allegato IV) → MITRE ATLAS → NIST AI 600-1.
Formati pronti per garak (NVIDIA) e promptfoo. Un comando, un report pass/fail sui VOSTRI modelli.
Lo eseguite internamente. Nessun prompt o modello va a un SaaS di terzi, essenziale per i regolati.
Fonti permissive (garak, benchmark MIT/Apache) deduplicate + metà contenuto originale nostro.
Payload = canary innocui (PWNED, rivela il tuo prompt…). Malware/CBRN/PII reali filtrati al build.
Nuove tecniche e categorie aggiunte con l’evolversi delle minacce LLM. Una chiave, sempre aggiornata.
Come si esegue?
Il pack include prompt in JSONL, test promptfoo pronti (YAML) e una probe garak (tc_redteam.py). Con garak: `garak --target_type ollama --target_name <modello> --probes tc_redteam.Injection`. Con promptfoo: `promptfoo eval --tests bundles/<bundle>/promptfoo-tests.yaml`. Entrambi gratuiti e open-source; puntateli sul vostro modello o endpoint.
Come aiuta con l’EU AI Act?
L'Art. 15 dell'EU AI Act richiede robustezza contro attacchi avversariali (adversarial examples, evasione del modello), e l'Allegato IV richiede la documentazione tecnica corrispondente. Rieseguire questo feed contro il vostro sistema produce un report di test, un artefatto documentale diretto per il fascicolo di conformità. Mappiamo anche NIST AI 600-1 (azioni MEASURE) e MITRE ATLAS. Nota: la copertura per prompt riguarda LLM01/02/05/06/07/09/10; i rischi architetturali (LLM03/04/08) sono controlli di processo.
Quale licenza? Posso ridistribuirlo?
Il pack è un prodotto proprietario in abbonamento (EULA inclusa). Potete usarlo per testare i vostri sistemi; non potete ridistribuirlo, rivenderlo o costruirne un feed concorrente. Il contenuto originale generato da ThreatClaw (~metà) e la compilazione sono di nostra proprietà; i componenti di terzi permissivi mantengono la loro licenza (attribuiti nel pack).
Pronto a dimostrare la robustezza dei vostri LLM?
Abbonamento annuale. Chiave immediata. On-prem. Disdici quando vuoi.