中文

面向 IT 自动化的自然语言到 Bash 代码生成的无参考自动代码验证与细化:LLM 作为评判器

软件工程 2025-06-16 v1 计算与语言

摘要

为自动评估和选择最佳模型以提高 IT 自动化中自动化事件修复代码质量,关键在于验证生成的代码是否具有正确的语法和语义,以及是否可以按预期执行。目前有三种方法:1) 常规方法使用表面形式相似度指标(如 token 匹配、完全匹配等),存在诸多局限性;2) 基于执行的评估更关注代码功能,基于给定测试用例的通过/失败判断;3) LLM 作为评判器 (LLM-as-a-Judge) 利用 LLMs 对是否为给定问题的正确答案进行自动评估。本文聚焦于增强 LLM 作为评判器,使用双向功能匹配和逻辑表示进行无参考的 Bash 代码生成自动验证与细化,以选择 IT 自动化中自动化事件修复的最佳模型。我们将基于执行的评估作为基准来评估我们的 LLM 作为评判器指标。结果表明准确率高,与基于执行的评估高度一致(相较于基线提升最高可达 8%)。最后,我们构建了 Reflection 代码智能体,利用这些评估指标及其反馈,实现了显著性提高(准确率提升最高可达 24%)的自动化代码细化。

关键词

引用

@article{arxiv.2506.11237,
  title  = {LLM-as-a-Judge for Reference-less Automatic Code Validation and Refinement for Natural Language to Bash in IT Automation},
  author = {Ngoc Phuoc An Vo and Brent Paulovicks and Vadim Sheinin},
  journal= {arXiv preprint arXiv:2506.11237},
  year   = {2025}
}

备注

10 pages