PrefixGuard:从 LLM 智能体轨迹到在线故障预警监控器
人工智能
2026-05-08 v1
摘要
大语言模型(LLM)智能体现在执行长期的工具使用任务,其中最终结果检查可能来得太晚而无法干预。在线预警需要对异构轨迹的轻量级前缀监控器,但人工编写的事件模式脆弱且部署时的 LLM 判断成本高昂。我们引入了 PrefixGuard,这是一个从轨迹到监控器的框架,包含离线的 StepView 归纳步骤以及随后的监督式监控器训练。StepView 从原始轨迹样本中归纳确定性的类型化步骤适配器,监控器从终端结果学习事件抽象和前缀风险评分器。在 WebArena、-Bench、SkillsBench 和 TerminalBench 上,最强的 PrefixGuard 监控器分别达到 0.900/0.710/0.533/0.557 的 AUPRC。使用每种表示中最强的后端时,它们相比纯文本控制平均提升了 +0.137 AUPRC。在相同的前缀预警协议下,LLM 评判器仍然明显较弱。我们还推导了基于分数的精确率-召回率曲线下面积(AUPRC)的可观测性上限,该上限将监控器误差与在观测前缀中缺乏证据的故障区分开来。对于有限状态审计,事后确定性有限自动机(DFA)提取在 WebArena 和 -Bench 上保持紧凑(分别为 29 和 20 个状态),但在 SkillsBench 和 TerminalBench 上扩展到 151 和 187 个状态。最后,首次预警诊断表明,强排序并不意味着部署效用:WebArena 排序良好但无法支持低误报预警,而 -Bench 和 TerminalBench 保留了更多可操作的早期预警。总而言之,这些结果将 PrefixGuard 定位为一种实用的监控器合成方案,并提供了关于前缀预警何时转化为可操作干预的明确诊断。
引用
@article{arxiv.2605.06455,
title = {PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors},
author = {Xinmiao Huang and Jinwei Hu and Rajarshi Roy and Changshun Wu and Yi Dong and Xiaowei Huang},
journal= {arXiv preprint arXiv:2605.06455},
year = {2026}
}
备注
Under Review