面向 IT 自动化的自然语言到 Bash 代码生成的无参考自动代码验证与细化:LLM 作为评判器
软件工程
2025-06-16 v1 计算与语言
摘要
为自动评估和选择最佳模型以提高 IT 自动化中自动化事件修复代码质量,关键在于验证生成的代码是否具有正确的语法和语义,以及是否可以按预期执行。目前有三种方法:1) 常规方法使用表面形式相似度指标(如 token 匹配、完全匹配等),存在诸多局限性;2) 基于执行的评估更关注代码功能,基于给定测试用例的通过/失败判断;3) LLM 作为评判器 (LLM-as-a-Judge) 利用 LLMs 对是否为给定问题的正确答案进行自动评估。本文聚焦于增强 LLM 作为评判器,使用双向功能匹配和逻辑表示进行无参考的 Bash 代码生成自动验证与细化,以选择 IT 自动化中自动化事件修复的最佳模型。我们将基于执行的评估作为基准来评估我们的 LLM 作为评判器指标。结果表明准确率高,与基于执行的评估高度一致(相较于基线提升最高可达 8%)。最后,我们构建了 Reflection 代码智能体,利用这些评估指标及其反馈,实现了显著性提高(准确率提升最高可达 24%)的自动化代码细化。
引用
@article{arxiv.2506.11237,
title = {LLM-as-a-Judge for Reference-less Automatic Code Validation and Refinement for Natural Language to Bash in IT Automation},
author = {Ngoc Phuoc An Vo and Brent Paulovicks and Vadim Sheinin},
journal= {arXiv preprint arXiv:2506.11237},
year = {2025}
}
备注
10 pages