大模型越狱攻防演练平台
将不同攻击、模型、防御和评分接入统一测试流程,并分析 PPL / NLL 类检测方法在不同攻击与良性输入上的表现。
先统一测试口径
攻击、模型与防御各自有独立实现。平台首先解决的是如何把它们放入同一个可替换、可复用的执行过程。
不同攻击需要统一进入方式
GCG、PAIR、FlipAttack 的生成过程不同,但评测需要统一组织任务、模型请求和结果记录。
结果需要支持横向比较
开源模型、闭源 API 与多类防御方案需要在明确版本和指标后进行量化对比。
四段自动化测试流程
攻击、模型、防御和评分分别作为可替换环节进入流程,平台统一负责调度、记录和结果组织。
攻击任务
选择攻击方法、目标问题与运行配置。
模型调用
接入开源模型或闭源 API,记录完整输出。
防御处理
挂载对应防御方案,观察攻击链路变化。
评测记录
统一保存攻击结果、判定和运行信息。
攻击与防御方法覆盖
平台分别接入 8+ 种攻击方法与 8+ 种防御方法。两类方法通过统一流程组合测试,而不是与模型类型、流程阶段或分析指标并列计数。
| 方法类别 | 规模 | 平台工作 | 比较方式 |
|---|---|---|---|
| 攻击方法 | 8+ 种 | 统一不同攻击实现的任务接口、运行配置与结果记录。 | 固定模型、防御与评分条件,比较攻击表现。 |
| 防御方法 | 8+ 种 | 将已有防御方法与项目中的主动防御探索接入同一平台。 | 固定攻击、模型与评分条件,比较防御效果。 |
模型范围覆盖开源模型与闭源 API;攻击方法和防御方法通过上一节的“攻击、模型、防御、评分”四段流程组合运行。
PPL / NLL 检测分析
以 token NLL / PPL 时序特征作为 1 个检测基线,重点检查跨攻击迁移、良性样本误报和阈值稳定性 3 类泛化问题。
token NLL / PPL 时序特征对 GCG 等部分优化型攻击具有识别信号,可作为检测基线继续比较。
在 PAIR、FlipAttack 等不同攻击范式上需要单独验证,不能从单一攻击结果自然推出通用有效性。
长度匹配、困惑度偏高或分布不同的良性输入仍可能触发误报,需要结合阈值与数据分层分析。
阈值变化会改变拦截与误报之间的平衡;AUROC 或局部识别效果只描述当前样本上的区分能力。
项目结论
统一测试流程支持横向比较,但检测方法的有效性仍取决于攻击类型、样本分布和阈值设置。
项目由团队协作完成,个人工作集中在攻击方法接入、测试流程集成与评测分析。
平台接入 GCG、PAIR、FlipAttack、开源模型与闭源 API,并统一组织攻击、模型、防御和评分流程。
PPL / NLL 特征仅对部分优化型攻击显示信号;跨攻击迁移、良性误报和阈值敏感性是主要泛化边界。
当前实验尚未形成统一协议下的通用主动防御结论。