AXIOM:基于规则扰动和多源质量校准的 LLM 作为评判者代码基准测试
软件工程
2025-12-24 v1 人工智能
摘要
大型语言模型 (LLM) 正在增多地部署于实际软件工程场景,推动了代码评估指标的发展,以研究 LLM 生成代码的质量。传统基于规则的指标仅根据程序与参考程序的表面级相似性给予评分,而非深入分析功能和代码质量。为解决这一限制,研究者们开发了 LLM 作为评判者指标,通过提示 LLM 对代码进行评估和评分,并构建了 various code evaluation benchmarks 来验证其有效性。然而,这些基准存在关键局限,阻碍可靠评估:部分特征包含粗粒度二元标签,将 rich code behavior 简化为单一比特的信息,掩盖了细微错误;另一些提出细粒度但主观、模糊定义的评估标准,引入了基于手动标注评分的不可靠性,这些是其所依赖的 ground-truth;此外,这些方法常使用不可控的数据合成方法,导致评分分布不平衡,难以代表真实世界的代码生成场景。为构建具有 diverse 程序且在 various quality 水平上分布均衡的基准,并简化手动标注流程,我们提出 AXIOM,一个基于扰动的框架,用于大规模合成代码评估基准。它将程序评分重新定义为部署所需的精炼工作,包含两个阶段:(1) 规则引导的扰动,通过提示 LLM 对现有高质量程序应用一系列预定义扰动规则以修改其功能和代码质量,从而精确控制每个程序的目标评分以实现均衡的评分分布;(2) 多源质量校准,该过程首先选择一小部分...
引用
@article{arxiv.2512.20159,
title = {AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration},
author = {Ruiqi Wang and Xinchen Wang and Cuiyun Gao and Chun Yong Chong and Xin Xia and Qing Liao},
journal= {arXiv preprint arXiv:2512.20159},
year = {2025}
}