大模型越狱攻防演练平台

将不同攻击、模型、防御和评分接入统一测试流程,并分析 PPL / NLL 类检测方法在不同攻击与良性输入上的表现。

攻击评测 统一测试 检测分析
项目时间
—
项目角色
核心成员
主要工作
攻击接入、测试流程与检测分析
01

先统一测试口径

攻击、模型与防御各自有独立实现。平台首先解决的是如何把它们放入同一个可替换、可复用的执行过程。

输入

不同攻击需要统一进入方式

GCG、PAIR、FlipAttack 的生成过程不同,但评测需要统一组织任务、模型请求和结果记录。

输出

结果需要支持横向比较

开源模型、闭源 API 与多类防御方案需要在明确版本和指标后进行量化对比。

02

四段自动化测试流程

攻击、模型、防御和评分分别作为可替换环节进入流程,平台统一负责调度、记录和结果组织。

01

攻击任务

选择攻击方法、目标问题与运行配置。

02

模型调用

接入开源模型或闭源 API,记录完整输出。

03

防御处理

挂载对应防御方案,观察攻击链路变化。

04

评测记录

统一保存攻击结果、判定和运行信息。

03

攻击与防御方法覆盖

平台分别接入 8+ 种攻击方法与 8+ 种防御方法。两类方法通过统一流程组合测试,而不是与模型类型、流程阶段或分析指标并列计数。

方法类别 规模 平台工作 比较方式
攻击方法 8+ 种 统一不同攻击实现的任务接口、运行配置与结果记录。 固定模型、防御与评分条件,比较攻击表现。
防御方法 8+ 种 将已有防御方法与项目中的主动防御探索接入同一平台。 固定攻击、模型与评分条件,比较防御效果。
共同测试条件

模型范围覆盖开源模型与闭源 API;攻击方法和防御方法通过上一节的“攻击、模型、防御、评分”四段流程组合运行。

04

PPL / NLL 检测分析

以 token NLL / PPL 时序特征作为 1 个检测基线,重点检查跨攻击迁移、良性样本误报和阈值稳定性 3 类泛化问题。

检测基线

token NLL / PPL 时序特征对 GCG 等部分优化型攻击具有识别信号,可作为检测基线继续比较。

跨攻击迁移

在 PAIR、FlipAttack 等不同攻击范式上需要单独验证,不能从单一攻击结果自然推出通用有效性。

良性样本误报

长度匹配、困惑度偏高或分布不同的良性输入仍可能触发误报,需要结合阈值与数据分层分析。

阈值与结果解释

阈值变化会改变拦截与误报之间的平衡;AUROC 或局部识别效果只描述当前样本上的区分能力。

05

项目结论

统一测试流程支持横向比较,但检测方法的有效性仍取决于攻击类型、样本分布和阈值设置。

项目角色

项目由团队协作完成,个人工作集中在攻击方法接入、测试流程集成与评测分析。

平台能力

平台接入 GCG、PAIR、FlipAttack、开源模型与闭源 API,并统一组织攻击、模型、防御和评分流程。

检测结论

PPL / NLL 特征仅对部分优化型攻击显示信号;跨攻击迁移、良性误报和阈值敏感性是主要泛化边界。

未覆盖范围

当前实验尚未形成统一协议下的通用主动防御结论。