中文

AOI:将失败轨迹转化为自动云诊断的训练信号

机器学习 2026-03-18 v3 人工智能

摘要

大型语言模型 (LLM) 智能体提供了一种数据驱动的方法,用于自动化站点可靠性工程 (SRE),但其企业部署受到三个挑战的限制:对专有数据的受限访问、在受权限管控环境下的不安全动作执行,以及封闭系统无法从失败中学习的能力。我们提出了 AOI (Autonomous Operations Intelligence),一个可训练的多智能体框架,将自动化操作建模为受安全约束下的结构化轨迹学习问题。我们的方法集成了三个关键组件。首先,一个可训练的诊断系统应用群相对政策优化 (GRPO) 将专家水平知识蒸馏到本地部署的开源模型中,实现无需暴露敏感数据即可进行偏好学习。其次,一个读写分离的执行架构将操作轨迹分解为观察、推理和行动阶段,允许在安全学习的同时防止未授权的状态变更。第三,一个失败轨迹闭环进化器从矿盾的轨迹中提取信息,并将其转换为纠正的监督信号,以实现持续的数据增强。在 AIOpsLab 基准测试中,我们的贡献带来了累积性的收益。 (1) AOI 运行时alone 在所有 86 个任务中实现 66.3% 的 best@5 成功率,超越了 prior state-of-the-art (41.9%) 高出 24.4 分。 (2) 添加 Observer GRPO 训练后,本地部署的 14B 模型在 63 个 held-out 任务上实现 42.9% 的 avg@1 成功率,处理未见的故障类型,超过 Claude Sonnet 4.5。 (3) Evolver 将 37 条失败轨迹转换为诊断指导,提高了端到端 avg@5 高出 4.8 分,同时将方差降低 35%。

关键词

引用

@article{arxiv.2603.03378,
  title  = {AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis},
  author = {Pei Yang and Wanyi Chen and Asuka Yuxi Zheng and Xueqian Li and Xiang Li and Haoqin Tu and Jie Xiao and Yifan Pang and Dongdong Zhang and Fuqiang Li and Alfred Long and Lynn Ai and Eric Yang and Bill Shi},
  journal= {arXiv preprint arXiv:2603.03378},
  year   = {2026}
}