RedCell
RedCell — 工具型 LLM Agent 安全评估平台
Agent 想做什么、尝试了什么、实际造成了什么影响?
将违规意图与实际执行分开记录。
要解决的问题
能调用数据库、文件和业务 API 的 LLM Agent 一旦被诱导,可能泄露数据或执行越权操作。由于模型回答具有不确定性,单纯维护一份固定的越狱提示词清单很难覆盖真实风险。
我的做法
我把红队测试设计成一套产出证据的实验系统,而不只是 Prompt 生成器:用 canary、权限检查和跨用户访问做确定性判定,并以固定 Token/成本预算和条件指纹公平比较 Static、Random、Thompson 与 LLM Controller。
具体实现
交付了端到端靶场、多轮执行、轨迹持久化、崩溃恢复和 fail-closed 六条件实验 Runner。776 项离线测试验证工程链路;18 次在线 Pilot 共执行 1,080 次攻击尝试,结果未支持自适应策略更优,下一轮正式 Provider 矩阵仍待运行。
查看技术详情收起技术详情技术栈与实现说明04
技术栈
使用 Python 3.11、asyncio、Pydantic、SQLAlchemy、Typer、Jinja2、SQLite、pytest、Ruff 和 Black;自动化测试无需 Provider 凭据即可完全离线运行。
- 独立开发面向工具型 LLM Agent 的开源防御性安全评估平台,覆盖提示注入、敏感数据泄露与越权工具调用,并以 Intent / Attempt / Impact 三层确定性证据区分违规意图、调用尝试和实际影响。
- 设计六条件、Token 预算约束的实验框架,比较 Static、Random、Thompson 与 LLM Controller,并实现条件指纹、分角色 Token 记账、SQLite 轨迹和崩溃后断点续跑。
- 通过 fail-closed 条件校验、跨进程 SQLite 限流和共享 429 冷却加固真实模型执行链路;系统通过 776 项离线测试以及 Ruff、Black 检查。
- 完成 18 次在线 Phase 0 Pilot,共执行 1,080 次攻击尝试且无 abandoned attempt;在数据未支持预设假设后保留 NOT SUPPORTED 结论及 Static/Random 基线。

