中文

ProbGuard: 面向LLM Agent安全的概率性运行时监控

人工智能 2026-03-30 v3 软件工程

摘要

大型语言模型(LLM)Agent日益跨越机器人、虚拟助手和网页自动化等领域。然而,其随机决策引入的安全风险在执行期间难以预判。现有的运行时监控框架,如AgentSpec,主要依赖反应式安全规则,仅在不安全行为逼近或发生后才检测违规,限制了其处理长期依赖的能力。我们提出ProbGuard,一个针对LLM Agent的主动运行时监控框架,通过概率风险预测来预判安全违规。ProbGuard将Agent执行抽象为符号状态,并从执行轨迹中学习离散时间马尔可夫链(DTMC)以建模行为动力学。在运行时,监控器估计未来执行到达不安全状态的概率,并在风险超过用户定义阈值时触发干预。为提高鲁棒性,ProbGuard在抽象中引入语义有效性约束,并在标准假设下为所学模型提供PAC式保证。我们在两个安全关键领域评估了ProbGuard:自动驾驶和具身化家庭Agent。在评估场景中,ProbGuard consistently预测了交通法规违规和碰撞,提前38.66秒发出警告。在具身化Agent任务中,ProbGuard将不安全行为降低最高可达65.37%,同时保持最高可达80.4%的任务完成率。ProbGuard以可扩展的开源运行时监控器形式实现,集成于LangChain Agent框架,引入的运行时开销最小。

关键词

引用

@article{arxiv.2508.00500,
  title  = {ProbGuard: Probabilistic Runtime Monitoring for LLM Agent Safety},
  author = {Haoyu Wang and Christopher M. Poskitt and Jiali Wei and Jun Sun},
  journal= {arXiv preprint arXiv:2508.00500},
  year   = {2026}
}