PROJECT 01 · SECURITY EVALUATION

Agent Skills 安全准入方案评测

第三方技能包进入 Agent 环境之前,安全检查方案能否同时做到有效拦截、控制误报,并在真实工程路径中稳定运行?

安装前准入 评测协议 失败归因
主评测规模 208 条 benchmark 样本
当前适用范围 OpenClaw 测试场景
结论等级 局部验证,保留研究边界
01

为什么放在安装前检查

Skills 通常以独立文件包进入系统。来源、脚本和权限组合在安装前已经可见,适合先完成一次明确的准入判断。

BEFORE INSTALL

把风险拦在运行环境之外

静态文件、指令文本、脚本入口和权限声明可以在技能真正执行前被检查,减少只依赖运行时兜底的压力。

EVALUATION GAP

安全方案本身也需要被评测

只看“是否报警”不足以判断方案质量,还需要同时观察漏检、误报、解析失败和长上下文污染。

02

评测对象与方法

把治理方案放在同一个问题框架下观察:检查什么、如何判断、失败后怎样复核。

部分 当前做法 状态
评测对象 规则检查、语义审计及混合方案;结论限定在对应实现和 OpenClaw 测试环境。 已形成
核心指标 拦截能力、误报控制、工程稳健性三个维度。 已形成
验证协议 控制模型与审计环境,通过双模型裁判复核语义判断。 已执行
风险覆盖矩阵 六类行为风险的原始附件尚未进入公开材料,本页不自行补写。 待补材料
03

结果分两层看

主评测结果与小样本趋势观察分开呈现,避免把不同样本量、不同运行形态直接排成优劣榜。

208 条样本主评测 结构示意,不代表实验数值
拦截能力
已记录
误报控制
待核对
工程稳健性
已观察
04

失败不只记成一个分数

评测过程中的异常沿“现象、根因、修复、影响”拆开记录。当前材料可确认前三步,量化影响仍需逐项补齐。

PHENOMENON

样本没有进入检查

表面上像方案漏检,实际先表现为路径读取异常。

ROOT CAUSE

路径解析与运行位置不一致

工具接收到的路径和真实文件位置之间存在偏差。

FIX

修正文件定位过程

先确认真实路径,再让样本进入后续审计流程。

IMPACT

影响仍需量化

此版只保留恢复评测链路的事实,不补写修复后的提升比例。

05

形成的四层治理链路

四层描述的是治理方案,不表示每一层都已经完成同口径生产验证。

LAYER 01

静态规则

先处理可直接识别的文件、脚本和权限风险。

LAYER 02

语义审计

补充对复杂指令、意图和上下文关系的判断。

LAYER 03

情报纠偏

利用来源与信誉信息辅助复核异常结果。

LAYER 04

隔离审计

在更受控的环境中观察高风险样本和执行行为。

06

结论边界

公开页面只保留当前材料能够支撑的结论,不把平台特定实验改写成平台无关事实。

平台关系

Claude 架构可作为方法参考;核心评测对象是 OpenClaw 场景,两者关系仍需在正式版本中解释。

结果口径

208 条主评测与若干小样本观察不合并比较,厂商、模型和实现版本需要补齐。

外部依据

OWASP 对应关系暂不作为强结论,等待引用与实际覆盖证据核对。

公开范围

不展示反向 Shell、数据外传、持久化等攻击样本的完整测试配方。