Agent Skills 安全准入方案评测
面向第三方 Agent Skills 的安装前安全检查,构建评测数据、比较不同准入方案,并通过运行日志解释漏报、误判与工具链故障。
把第三方 Skills 的安全检查前移到安装之前
项目首先定义需要检查的风险,再构建人工核验样本,将静态扫描、混合扫描与 Agent 自审放入同一评测框架。除比较检查结果外,还通过运行日志确认样本是否真正进入评测流程。
覆盖显性代码攻击、隐性文档注入,以及命令执行、文件操作和网络通信等行为风险。
比较静态扫描、混合扫描与 Agent 自审,观察拦截能力、误报控制和工程稳健性。
定位路径解析、运行目录和 JSON 结果读取问题,区分真实漏报、语义误判与工具故障。
为什么放在安装前检查
Skills 通常以独立文件包进入系统。来源、脚本和权限组合在安装前已经可见,适合先完成一次明确的准入判断。
把风险拦在运行环境之外
静态文件、指令文本、脚本入口和权限声明可以在技能真正执行前被检查,减少只依赖运行时兜底的压力。
安全方案本身也需要被评测
只看“是否报警”不足以判断方案质量,还需要同时观察漏检、误报、解析失败和长上下文污染。
评测设计与数据结构
将样本、风险分类、检查方案和评价维度放在同一套协议中,确保不同方案的结果可以复核和比较。
- 01样本筛选
从 ClawHub 技能中定位正常与高风险候选样本。
- 02分类与人工核验
按文本风险和行为风险标注,确认样本内容与预期标签。
- 03运行检查方案
在统一输入与环境下执行静态、混合和 Agent 自审方案。
- 04复核与链路归因
结合输出和日志区分报警、真实漏报、语义误判与工具故障。
数据与结果口径
结果报告同时记录数据基础、评价维度和链路状态,避免把没有真正执行的样本直接计入漏报。
从 ClawHub 技能中筛选、分类并人工核验 200+ 样本,形成用于安装前准入方案比较的安全评测集。
同时观察拦截能力、误报控制与工程稳健性;检出率和误报率需要在相同运行条件下比较。
样本未进入检查、审计结果丢失或解析失败,都可能在表面上表现为方案漏报,需要结合运行日志复核。
从风险定义到分层治理
内容风险与行为风险采用不同的描述方式,经过对应的检测通道形成证据,再进入可组合的四层治理链路。
内容风险
显性代码攻击与隐性文档注入,通过代码静态分析和文本语义审计识别。
行为风险
6 大类、30+ 小类,通过检测方法与黑盒场景验证技能的实际能力边界。
-
L1
静态规则
先处理可直接判定的文件、脚本与权限风险。
-
L2
语义审计
再判断复杂指令、文档注入、意图与上下文关系。
-
L3
情报纠偏
结合来源与信誉信息复核异常结果,控制误报。
-
L4
隔离审计
对高风险或难以判定的技能,在独立上下文或受控环境中继续验证。
项目结论
安装前检查能够提前发现部分高风险技能,但评测结果仍受到测试场景、工具实现和运行环境影响。
结论限定在 OpenClaw 测试场景、对应工具实现和实际运行环境。
检出率和误报率只有在样本、模型、实现版本和运行方式一致时才具有可比性。
情报校验和隔离审计用于补充静态扫描与 Agent 自审,尚未进入统一协议下的结果比较。
高风险攻击样本保留在受控测试范围,不公开反向 Shell、数据外传和持久化等完整执行配方。