中文

技能描述讲述真相吗?检测代码支持的 LLM 技能中的未披露安全行为

密码学与安全 2026-05-14 v1

摘要

LLM 生态系统中的程序化技能包含自然语言描述和可执行实现文件。用户和 LLM 依赖该描述来理解技能的范围。然而,实现可能执行某些未在描述中声明的安全相关操作,如凭证访问、网络通信或命令执行。我们通过询问实现是否 staying within 声明在描述中的安全相关范围来研究此描述-实现不一致问题。我们手动分析 920 个真实世界的程序化技能,并构建一个 11 类的安全属性分类法。基于此分类法,我们构建 SKILLSCOPE,通过从实现中构造源级安全属性图 (SPG) 并执行 LLM 辅助一致性检查来实现检测。SPG 节点保留源级代码模式,而非抽象的分类标签,保留用于检查的细粒度证据。在 4556 个程序化技能上进行双盲人工审核后,SKILLSCOPE 在识别不一致方面达到 84.8% 的精确率和 96.5% 的召回率。确认的不一致影响 9.4% 的技能,而粗糙描述(即实现细节仍在声明范围内)的案例占 24.3%。消融实验确认,SPG 和分类法都具有贡献:移除分类法将精确率从 87.8% 降至 72.3%,移除 SPG 将召回率从 94.7% 降至 79.0%。

关键词

引用

@article{arxiv.2605.12875,
  title  = {Do Skill Descriptions Tell the Truth? Detecting Undisclosed Security Behaviors in Code-Backed LLM Skills},
  author = {Wenhui He and Yue Li and Bang Fu and Huan Xing and Xing Fan and ZeHua Zhang and Baoning Niu},
  journal= {arXiv preprint arXiv:2605.12875},
  year   = {2026}
}

备注

11 pages, 3 figures, 9 tables