RedCell
RedCell — ツール利用型 LLM エージェントのセキュリティ評価
開発・研究
ツール利用型 LLM エージェント向けの、オープンソースの防御的セキュリティ評価基盤です。予算制約下で攻撃探索を実行し、違反意図・ツール実行の試行・実際の影響を分離して、各結果を監査可能な証拠として保存します。
ソースコードを見るエージェントの意図、試行、実際の影響は?
違反意図を実行とは別に記録します。
課題
ツールを呼び出す LLM エージェントはデータベース、ファイル、業務 API にアクセスできるため、操作されるとデータを漏らしたり、実行すべきでない動作を行う可能性があります。攻撃面は自然言語による判断とモデルの非決定性から生じるため、固定のジェイルブレイク文面の一覧では対応できません。
アプローチ
レッドチーミングを単なるプロンプト生成ではなく、証拠を生み出す実験システムとして設計しました。canary、権限チェック、ユーザー間アクセスを確定的に計測し、固定のトークン・コスト予算と条件フィンガープリントで Static、Random、Thompson、LLM Controller を比較します。
実装内容
エンドツーエンドのアリーナ、複数ターン実行、トレース永続化、クラッシュ後の再開、fail-closed な六条件実験 Runner を構築しました。776 件のオフラインテストで実装を検証し、18 回・1,080 試行のオンライン Pilot では適応手法の優位性は支持されませんでした。次の正式な Provider マトリクスは未実行です。
技術詳細を見る技術詳細を閉じる使用技術と実装内容04
使用技術
Python 3.11、asyncio、Pydantic、SQLAlchemy、Typer、Jinja2、SQLite、pytest、Ruff、Black。自動テストは Provider の認証情報なしで完全にオフライン実行できます。
- ツール利用型 LLM エージェント向けのオープンソース防御的セキュリティ評価基盤を開発し、プロンプトインジェクション、機密データ漏洩、権限外ツール利用を Intent / Attempt / Impact の確定的証拠で評価しました。
- Static、Random、Thompson、LLM Controller を比較する六条件・トークン予算型の実験基盤を設計し、条件フィンガープリント、役割別トークン計測、SQLite トレース、クラッシュ後の再開を実装しました。
- fail-closed な条件検証、プロセス間 SQLite レート制限、共有 429 クールダウンで実モデル実行を堅牢化し、776 件のオフラインテストと Ruff・Black で検証しました。
- 18 回のオンライン Phase 0 Pilot で 1,080 件の攻撃試行を中断なしで実行し、事前仮説が支持されなかったため NOT SUPPORTED として報告し、Static/Random を基準として維持しました。

