PROJECT 02 · RED TEAM EVALUATION

大模型越狱攻防演练平台

不同攻击方法、基座模型和防御方案如何放到同一条测试链路中,形成可重复的自动化红队测试与量化对比?

自动化红队 统一测试 防御探索
项目时间
项目角色 核心成员
公开结果 当前展示方法与系统边界
01

先统一测试口径

攻击、模型与防御各自有独立实现。平台首先解决的是如何把它们放入同一个可替换、可复用的执行过程。

INPUT

不同攻击需要统一进入方式

GCG、PAIR、FlipAttack 的生成过程不同,但评测需要统一组织任务、模型请求和结果记录。

OUTPUT

结果需要支持横向比较

开源模型、闭源 API 与多类防御方案需要在明确版本和指标后进行量化对比。

02

自动化测试流程

每一类实现都作为可替换环节进入测试流程,平台负责调度和记录,而不是把单一攻击方法写死。

STEP 01

攻击任务

选择攻击方法、目标问题与运行配置。

STEP 02

模型调用

接入开源模型或闭源 API,记录完整输出。

STEP 03

防御处理

挂载对应防御方案,观察攻击链路变化。

STEP 04

评测记录

统一保存攻击结果、判定和运行信息。

03

当前覆盖对象

这一版只列现有首页已经明确出现的范围,不补写模型版本、样本量或实现深度。

层面 已出现的对象 正式页面还需补充
攻击方法 GCG、PAIR、FlipAttack 代码版本、参数与实际运行范围
模型 开源模型、闭源 API 具体模型、版本与调用日期
防御 多类防御算法,以及低开销主动防御探索 统一指标、基线与运行开销
输出 自动化红队测试与量化对比流程 样本量、成功率和结果表
04

防御探索

在基础测试流程之外,项目尝试从攻击过程信号和交互链路两个方向增加防御能力。

SIGNAL

PPL 时序波动

尝试使用 CNN 分析 PPL 的时序变化,探索低开销的主动检测方式。

INTERACTION

干扰自动化攻击链路

加入意图分离与蜜罐响应,观察能否打断或误导自动化攻击过程。

量化结果区 正式数据整理后替换
攻击成功率
待补
防御效果
待补
运行开销
待补
05

公开边界

当前页面主要展示项目怎么组织问题。正式结果需要回到实验记录后再补充。

角色范围

项目身份为核心成员,不改写为独立完成。

实现深度

当前材料没有区分复现、集成和独立实现的具体比例,正式页面需要逐项标明。

量化结论

没有公开样本量与结果数字之前,只展示测试流程和防御探索,不展示虚构曲线。