中文

面向IT自动化任务的大语言模型:我们准备好了吗?

计算与语言 2025-05-28 v1 软件工程

摘要

LLMs在代码生成方面展现出潜力,但其在IT自动化任务中的有效性,尤其是对于Ansible等工具,仍缺乏充分研究。现有基准测试主要依赖合成任务,无法反映使用Ansible等IT自动化工具的从业者的实际需求。我们提出了ITAB(IT自动化任务基准),包含126项多样化任务(如配置服务器、管理文件),其中每项任务都考虑了状态协调:这是IT自动化工具独有的属性。ITAB通过在受控环境中的动态执行,评估LLMs生成功能性Ansible自动化脚本的能力。我们评估了14个开源LLMs,其中没有一个在pass@10上的成功率超过12%。为了解释这些低分,我们分析了所评估LLMs的1,411次执行失败,并识别出两大类常见语义错误:与状态协调相关推理的失败(合计44.87%,包括变量(11.43%)、主机(11.84%)、路径(11.63%)和模板(9.97%)问题)以及特定模块执行知识的不足(合计24.37%,包括属性和参数(14.44%)及模块(9.93%)错误)。我们的发现揭示了开源LLMs在跟踪状态变化和应用特定模块知识方面的关键局限性,表明可靠的IT自动化需要在状态推理和特定领域执行理解方面取得重大进展。

关键词

引用

@article{arxiv.2505.20505,
  title  = {Large Language Models for IT Automation Tasks: Are We There Yet?},
  author = {Md Mahadi Hassan and John Salvador and Akond Rahman and Santu Karmaker},
  journal= {arXiv preprint arXiv:2505.20505},
  year   = {2025}
}

备注

8 pages