中文

技能即可验证制品:面向人机协互智能体运行时的信任模式与双向正确性准则

密码学与安全 2026-05-18 v2 人工智能 多智能体系统 软件工程

摘要

智能体技能——结构化的指令、脚本和参考文件包,旨在增强大型语言模型(LLM)的能力而无需修改模型本身——已从便利性工具发展为一级部署制品。加载它们的运行时继承了包管理器和操作系统始终面临的同一问题:某项内容声称某种行为;运行时必须决定是否相信其陈述。我们提前阐明本文的核心论点:技能是不可信的代码,直到经验证明;加载它的运行时必须强制执行默认信任,而非从签名、许可证或来源注册表中推断信任。若不进行技能验证,人机协互(HITL)门控必须在每一次不可逆调用时触发——这在实际操作中是不可行的,并且在规模化后退化为 rubber-stamping。将技能验证视为独立的、受控的过程后,HITL仅针对未验证的内容触发,系统才得以可持续。我们提出了信任模式,包括每个技能清单上的显式验证等级;基于该验证等级的能力门控及其HITL策略;满足对抗性集合训练中任何候选验证程序的双向正确性准则;以及从工作开源参考实现抽象出的十项规范性指南的可携运行时配置。该工作不依赖特定框架或模型;此处的任何内容均无需重新训练、微调或专有基础设施。

关键词

引用

@article{arxiv.2605.00424,
  title  = {Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes},
  author = {Alfredo Metere},
  journal= {arXiv preprint arXiv:2605.00424},
  year   = {2026}
}