A segurança dos seus LLMs, testada e comprovada em conformidade.
~31.000 prompts adversariais defensivos (injeção, jailbreak, vazamento de dados, toxicidade, agência excessiva, desinformação…) para reproduzir contra SEUS modelos com ferramentas gratuitas (garak, promptfoo). O relatório resultante é sua evidência de robustez para o dossiê EU AI Act Anexo IV. On-prem, nada sai da sua infraestrutura.
What we added recently
A living feed: here is the coverage added to it, dated.
- +274 sondes
- +82 sondes
- +58 sondes
- +104 sondes
Oito superfícies de ataque LLM cobertas.
LLM01, injeções diretas/indiretas, DAN, ofuscação, many-shot, smuggling Unicode.
LLM02, extração de system-prompt, segredos, PII, vazamento do turno anterior.
LLM05, canários inertes XSS/SQLi/SSTI/exfil que o código a jusante pode tratar mal.
LLM06, chamadas proxy a ferramentas perigosas (exclusão, exfil e-mail, shell) sem aprovação.
LLM09, fatos falsos, citações/pacotes alucinados, adesão a premissas falsas.
LLM10, esgotamento de recursos / denial-of-wallet (loops, expansão recursiva).
+ dois bundles de benchmarks de referência (permissivos): recusa de conteúdo nocivo e geração de toxicidade. Cada prompt é rotulado com técnica + categoria OWASP + técnica MITRE ATLAS, com relatório de cobertura. ~50% do conteúdo é original (próprio).
Prova de conformidade, não apenas prompts.
Cada prompt → OWASP LLM Top 10 → EU AI Act (Art. 15 / Anexo IV) → MITRE ATLAS → NIST AI 600-1.
Formatos prontos para garak (NVIDIA) e promptfoo. Um comando, um relatório pass/fail nos SEUS modelos.
Você executa internamente. Nenhum prompt ou modelo é enviado a um SaaS de terceiros, essencial para regulados.
Fontes permissivas (garak, benchmarks MIT/Apache) deduplicadas + metade de conteúdo original nosso.
Payloads = canários inofensivos (PWNED, revele seu prompt…). Malware/CBRN/PII real filtrado no build.
Novas técnicas e categorias adicionadas conforme as ameaças LLM evoluem. Uma chave, sempre atual.
Como executo?
O pack traz prompts em JSONL, testes promptfoo prontos (YAML) e uma probe garak (tc_redteam.py). Com garak: `garak --target_type ollama --target_name <modelo> --probes tc_redteam.Injection`. Com promptfoo: `promptfoo eval --tests bundles/<bundle>/promptfoo-tests.yaml`. Ambas ferramentas são grátis e open-source; aponte-as ao seu modelo ou endpoint.
Como ajuda com o EU AI Act?
O Art. 15 do EU AI Act exige robustez contra ataques adversariais (adversarial examples, evasão de modelo), e o Anexo IV exige a documentação técnica correspondente. Reproduzir este feed contra o seu sistema produz um relatório de teste, uma peça documental direta para o seu dossiê de conformidade. Também mapeamos NIST AI 600-1 (ações MEASURE) e MITRE ATLAS. Nota: a cobertura por prompt visa LLM01/02/05/06/07/09/10; os riscos arquiteturais (LLM03/04/08) são controles de processo.
Qual licença? Posso redistribuí-lo?
O pack é um produto proprietário de assinatura (EULA incluída). Você pode usá-lo para testar seus próprios sistemas; não pode redistribuí-lo, revendê-lo ou construir um feed concorrente. O conteúdo original gerado pela ThreatClaw (~metade) e a compilação são nossa propriedade; os componentes de terceiros permissivos mantêm sua licença (atribuídos no pack).
Pronto para provar a robustez dos seus LLMs?
Assinatura anual. Chave instantânea. On-prem. Cancele quando quiser.