中文

SkillSieve:检测恶意AI代理技能的分层分流框架

密码学与安全 2026-05-27 v2 人工智能

摘要

OpenClaw的ClawHub市场托管了数以万计的社区贡献代理技能(2026-04-04快照中为49,592个),近期审计显示其中13-26%包含安全漏洞。正则扫描器会遗漏混淆的有效载荷;形式静态分析器无法读取隐藏提示注入和社交工程的自然语言SKILL.md指令。两种方法均无法覆盖两种模态。SkillSieve是一个三层检测框架,仅在必要时进行更深入分析。第一层通过召回率调优的启发式评分器运行正则、AST和元数据检查,过滤86%的体量。第二层将可疑技能路由至LLM,将分析拆分为四个并行子任务并输出结构化结果。第三层将高风险技能交由三个LLM组成的评审团独立投票并在分歧时辩论。我们在49,592个真实ClawHub技能和五种规避技术的对抗样本上进行了评估,在440美元ARM单板计算机上运行流水线。在390个技能的标注基准上,SkillSieve实现了F1=0.920(精确率0.912,召回率0.929),每个技能成本0.006美元。可选的XGBoost快速路径减少了32%的第二层/第三层LLM调用,F1降低1.6分,同时保持完整流水线的召回率(0.929)。为实现跨生态系统泛化,我们将框架适配至Feishu/Lark并扫描了52个真实软件包,其中第二层纠正了第一层因领域特定习语产生的误报,表明向类似企业平台低成本适配的路径。我们将SkillSieve部署为Feishu聊天机器人,用于实时技能审查。代码、数据和基准已开源。

关键词

引用

@article{arxiv.2604.06550,
  title  = {SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills},
  author = {Yinghan Hou and Zongyou Yang and Zaihu Pang and Xiujun Ma},
  journal= {arXiv preprint arXiv:2604.06550},
  year   = {2026}
}

备注

10 pages, 2 figures, 6 tables