あなたのLLMのセキュリティを、 テストし、準拠を証明。
約31,000件の防御的な敵対的プロンプト(インジェクション、ジェイルブレイク、データ漏洩、有害性、過剰なエージェンシー、誤情報など)を、無料ツール(garak、promptfoo)であなたのモデルに再生。得られるレポートはEU AI Act附属書IVの堅牢性の証拠になります。オンプレミス、データは外に出ません。
What we added recently
A living feed: here is the coverage added to it, dated.
- +274 sondes
- +82 sondes
- +58 sondes
- +104 sondes
8つのLLM攻撃面をカバー。
LLM01 · 直接/間接インジェクション、DAN、難読化、many-shot、Unicodeスマグリング。
LLM02 · システムプロンプト抽出、機密、PII、前ターン漏洩。
LLM05 · 下流コードが誤処理しうる不活性のXSS/SQLi/SSTI/持ち出しカナリア。
LLM06 · 承認なしの危険なツール呼び出しプロキシ(削除、メール持ち出し、シェル)。
LLM09 · 虚偽の事実、幻覚の引用/パッケージ、誤った前提への同意。
LLM10 · リソース枯渇/デニアル・オブ・ウォレット(ループ、再帰展開)。
+ 参照ベンチマーク(寛容ライセンス)由来の2バンドル:有害コンテンツ拒否と毒性生成。各プロンプトは技術+OWASPカテゴリ+MITRE ATLAS技術でラベル付けされ、カバレッジレポート付き。約50%が自社オリジナル(専有)。
単なるプロンプトではなく、コンプライアンスの証拠。
各プロンプト → OWASP LLM Top 10 → EU AI Act(第15条/附属書IV)→ MITRE ATLAS → NIST AI 600-1。
garak(NVIDIA)とpromptfoo対応フォーマット。1コマンドで、あなたのモデルの合否レポート。
社内で実行。プロンプトやモデルは第三者SaaSに送信されません,規制対象組織に不可欠。
寛容ライセンスのソース(garak、MIT/Apacheベンチマーク)を重複排除 + 半分は自社オリジナル。
ペイロード = 無害なカナリア(PWNED、プロンプトを明かせ…)。実マルウェア/CBRN/実PIIはビルド時に除去。
LLMの脅威の進化に応じて新技術・カテゴリを追加。1つのキーで常に最新。
どう実行する?
パックはJSONLプロンプト、promptfooテスト(YAML)、garakプローブ(tc_redteam.py)を同梱。garak:`garak --target_type ollama --target_name <モデル> --probes tc_redteam.Injection`。promptfoo:`promptfoo eval --tests bundles/<bundle>/promptfoo-tests.yaml`。どちらも無料のOSSで、あなたのモデルやエンドポイントに向けます。
EU AI Actにどう役立つ?
EU AI Act第15条は敵対的攻撃(敵対的サンプル、モデル回避)への堅牢性を、附属書IVは対応する技術文書を要求します。このフィードをあなたのシステムに再生するとテストレポートが得られ、コンプライアンス資料の直接的な文書になります。NIST AI 600-1(MEASUREアクション)とMITRE ATLASにも対応。注:プロンプトによるカバレッジはLLM01/02/05/06/07/09/10が対象で、アーキテクチャ的リスク(LLM03/04/08)はプロセス統制です。
ライセンスは?再配布できる?
本パックは専有のサブスクリプション製品です(EULA同梱)。自社システムのテストに使用できますが、再配布・再販・競合フィードの構築はできません。ThreatClawが生成したオリジナル(約半分)と編纂物は当社の所有物であり、寛容ライセンスの第三者コンポーネントはそのライセンスを保持します(パック内で帰属表示)。
LLMの堅牢性を証明する準備は?
年間サブスクリプション。即時にキー発行。オンプレミス。いつでも解約可。