OpsEval:面向大语言模型的综合IT运维基准套件
人工智能
2025-06-18 v5 网络与互联网体系结构
摘要
信息技术(IT)运维(Ops),特别是智能运维(AIOps),是保障现有信息系统有序稳定运行的基础。根据Gartner的预测,使用AI技术进行自动化IT运维已成为新趋势。在NLP相关任务中展现出卓越能力的大语言模型(LLMs),正于AIOps领域显示出巨大潜力,例如故障根因分析、运维脚本生成以及告警信息摘要等方面。然而,当前LLMs在Ops任务中的表现尚待确定。本文提出OpsEval,一个专为LLMs设计的综合任务导向Ops基准。OpsEval首次在不同能力层级上评估LLMs在各类关键场景中的熟练度。该基准包含7184道英文与中文多选题以及1736道问答(QA)格式题。通过对当前领先大语言模型进行全面性能评估,我们展示了各种LLM技术如何影响Ops性能,并讨论了与模型量化、QA评估和幻觉问题等相关的发现。为确保评估可信度,我们邀请数十位领域专家人工审核题目。同时,我们开源了20%的测试QA以协助当前研究者对其OpsLLM模型进行初步评估。其余80%未公开数据用于消除测试集泄露问题。此外,我们构建了实时更新且将持续更新的在线排行榜,确保任何新出现的LLMs都能被及时评估。我们的数据集与排行榜均已公开。
引用
@article{arxiv.2310.07637,
title = {OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models},
author = {Yuhe Liu and Changhua Pei and Longlong Xu and Bohan Chen and Mingze Sun and Zhirui Zhang and Yongqian Sun and Shenglin Zhang and Kun Wang and Haiming Zhang and Jianhui Li and Gaogang Xie and Xidao Wen and Xiaohui Nie and Minghua Ma and Dan Pei},
journal= {arXiv preprint arXiv:2310.07637},
year = {2025}
}