中文

自主LLM智能体中轨迹守卫:轻量级序列感知异常检测模型

机器学习 2026-01-05 v1 人工智能

摘要

自主LLM智能体生成的多步骤行动计划可能因情境错位或结构不连贯而失败。现有异常检测方法不适用于这一挑战:均值池化嵌入会稀释异常步骤,而对比学习方法则忽略序列结构。标准基于预训练嵌入的无监督方法在F1分数上无法超过0.69。我们引入轨迹守卫(Trajectory Guard),一种带混合损失函数的双向循环自动编码器,联合通过对比学习学习任务-轨迹对齐,通过重建学习序列有效性。这种双目标使其能够统一检测“错误任务的错误计划”和“结构错误的计划”。在覆盖合成扰动和真实世界失败(安全审计RAS-Eval和多智能体系统Who\&When)的基准测试中,我们在平衡数据集上实现0.88-0.94的F1分数,在不平衡外部基准测试中实现0.86-0.92的召回率。仅需32毫秒的推理延迟,使我们的方案比LLM Judge基线快17-27倍,使其能够在生产部署中实现实时安全验证。

关键词

引用

@article{arxiv.2601.00516,
  title  = {Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI},
  author = {Laksh Advani},
  journal= {arXiv preprint arXiv:2601.00516},
  year   = {2026}
}

备注

Accepted to AAAI Trustagent 2026