迈向可泛化的上下文感知异常检测:云环境中的大规模基准测试
人工智能
2025-10-07 v2
摘要
云环境中的异常检测既关键又充满挑战。现有的上下文级基准通常仅关注指标或日志,且往往缺乏可靠的标注;而大多数检测方法强调单一模态内的点异常,忽略了上下文信号,限制了其在现实世界中的适用性。构建结合指标和日志的上下文异常基准本质上具有困难:在真实服务器上重现异常场景通常是不可行或潜在有害的,而生成合成数据则带来了维持跨模态一致性的额外挑战。我们引入了 CloudAnoBench,这是一个用于云环境中上下文异常的大规模基准,包含 28 个异常场景和 16 个具有欺骗性的正常场景,带有 1,252 个标注案例和约 200,000 条日志与指标条目。与先前的基准相比,CloudAnoBench 表现出更高的模糊性和更大的难度,在此基准上,先前的机器学习方法和原始 LLM 提示均表现不佳。为了展示其效用,我们进一步提出了 CloudAnoAgent,这是一个基于 LLM 并通过符号验证增强的智能体,它集成了指标和日志。该智能体系统在 CloudAnoBench 上的异常检测和场景识别方面均取得了显著改进,并对现有数据集展现出强大的泛化能力。CloudAnoBench 和 CloudAnoAgent 共同为推进云系统中的上下文感知异常检测奠定了基础。项目页面:https://jayzou3773.github.io/cloudanobench-agent/
引用
@article{arxiv.2508.01844,
title = {Towards Generalizable Context-aware Anomaly Detection: A Large-scale Benchmark in Cloud Environments},
author = {Xinkai Zou and Xuan Jiang and Ruikai Huang and Haoze He and Parv Kapoor and Hongrui Wu and Yibo Wang and Jian Sha and Xiongbo Shi and Zixun Huang and Jinhua Zhao},
journal= {arXiv preprint arXiv:2508.01844},
year = {2025}
}