VIGIL:AI智能体技能中行为规约的运行时强制
密码学与安全
2026-06-25 v1
摘要
智能体系统日益通过第三方技能采取行动,使模型生成的决策能够影响文件、通信信道以及信息物理设备。这些技能通常包含自然语言规约,定义访问权限、披露限制、执行特权以及所需的先决条件。尽管此类规约描述了技能行为的预期边界,但其本身并不提供可执行的运行时强制。对其实行强制会带来上下文粒度挑战:即便某项策略针对特定任务上下文编写,监视器仍须决定观察哪些事件、保留何种状态、跨执行推理多远以及在哪里干预。选择错误的粒度可能要么阻断良性执行,要么遗漏仅在多个动作间浮现的违规。然而,大多数现有强制机制假定固定的事件模型或强制点。本工作中,我们提出 VIGIL,一种面向智能体系统的端到端运行时强制框架。VIGIL 将智能体的实际执行轨迹与来自技能规约、操作员定义约束以及跨越多个技能的全局规则的行为策略进行比对。为使此类策略可执行,VIGIL 引入一种策略语言,捕获围绕智能体-工具事件的上下文相关强制需求,包括时序依赖、参数约束与值流条件。该语言配合符号求值规则,将策略翻译为有限轨迹上的 SMT 约束,使 VIGIL 能够检测依赖于事件顺序、参数关系或跨调用值流的违规,而非依赖固定的单调用过滤器。在涵盖办公文档、运营与工程任务的真实 LLM 智能体运行上,VIGIL 以超过 95% 的召回率与低于 10% 的误报率检测策略违规。
引用
@article{arxiv.2606.26524,
title = {VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills},
author = {Ying Li and Yanju Chen and Hongbo Wen and Bosi Zhang and Hanzhi Liu and Peiran Wang and Yu Feng and Yuan Tian},
journal= {arXiv preprint arXiv:2606.26524},
year = {2026}
}