PROJECT 02 · RED TEAM EVALUATION
大模型越狱攻防演练平台
不同攻击方法、基座模型和防御方案如何放到同一条测试链路中,形成可重复的自动化红队测试与量化对比?
项目时间
—
项目角色
核心成员
公开结果
当前展示方法与系统边界
01
先统一测试口径
攻击、模型与防御各自有独立实现。平台首先解决的是如何把它们放入同一个可替换、可复用的执行过程。
不同攻击需要统一进入方式
GCG、PAIR、FlipAttack 的生成过程不同,但评测需要统一组织任务、模型请求和结果记录。
结果需要支持横向比较
开源模型、闭源 API 与多类防御方案需要在明确版本和指标后进行量化对比。
02
自动化测试流程
每一类实现都作为可替换环节进入测试流程,平台负责调度和记录,而不是把单一攻击方法写死。
攻击任务
选择攻击方法、目标问题与运行配置。
模型调用
接入开源模型或闭源 API,记录完整输出。
防御处理
挂载对应防御方案,观察攻击链路变化。
评测记录
统一保存攻击结果、判定和运行信息。
03
当前覆盖对象
这一版只列现有首页已经明确出现的范围,不补写模型版本、样本量或实现深度。
| 层面 | 已出现的对象 | 正式页面还需补充 |
|---|---|---|
| 攻击方法 | GCG、PAIR、FlipAttack | 代码版本、参数与实际运行范围 |
| 模型 | 开源模型、闭源 API | 具体模型、版本与调用日期 |
| 防御 | 多类防御算法,以及低开销主动防御探索 | 统一指标、基线与运行开销 |
| 输出 | 自动化红队测试与量化对比流程 | 样本量、成功率和结果表 |
04
防御探索
在基础测试流程之外,项目尝试从攻击过程信号和交互链路两个方向增加防御能力。
PPL 时序波动
尝试使用 CNN 分析 PPL 的时序变化,探索低开销的主动检测方式。
干扰自动化攻击链路
加入意图分离与蜜罐响应,观察能否打断或误导自动化攻击过程。
量化结果区
正式数据整理后替换
攻击成功率
待补
防御效果
待补
运行开销
待补
05
公开边界
当前页面主要展示项目怎么组织问题。正式结果需要回到实验记录后再补充。
角色范围
项目身份为核心成员,不改写为独立完成。
实现深度
当前材料没有区分复现、集成和独立实现的具体比例,正式页面需要逐项标明。
量化结论
没有公开样本量与结果数字之前,只展示测试流程和防御探索,不展示虚构曲线。