CodeFuse-CommitEval:评估 LLM 在提交消息和代码变更不一致检测中的能力
软件工程
2025-11-26 v1 人工智能
摘要
版本控制依赖提交消息传递代码变更的原因,但这些消息常质量较差且更关键的是与其 diff 不一致——即称为消息-代码不一致(MCI)。MCI 会误导审阅者、阻碍维护、污染研究数据集,甚至可能掩盖安全补丁。然而,目前尚无专门用于评估模型进行 MCI 检测的基准数据集。我们引入 CODEFUSE-COMMITEVAL,这是第一个专为 MCI 检测设计的基准数据集,基于 ApacheCM 数据集构建,以确保其多样性和质量。我们通过对原始一致提交进行基于规则的变异,生成七类不一致消息,并通过双重验证确保正负样本的有效性。使用包含消息-diff 对的标记数据集,我们在 vanilla 设置下评估了六个最先进的开源 LLM,同时采用三种数据增强策略:few-shot 提示、链式思考和扩展上下文。结果表明,模型在检测不一致提交的表现优于一致提交(平均召回率 85.95%,精确率 80.28%,特异度 63.8%);gpt-oss-20B 综合表现最佳,但使用的 token 数是其他模型的一倍以上。数据增强效果各不相同:相邻上下文有助于大型模型,但对小型模型引入噪声;few-shot 提升准确率并减少 token 使用,却普遍增加错误预测;链式思考提升精确率和特异度,但以牺牲召回率和更高的 token 消耗为代价。按类型分析显示,组件、文件路径和操作不一致较易被检测,但意图级别的“目的”不一致检测准确率较低且 token 成本更高。CODEFUSE-COMMITEVAL 为衡量、比较和推动 MCI 检测提供了严谨的基准框架,突显了捕获高层语义差距所需的更丰富上下文和平衡数据集。
引用
@article{arxiv.2511.19875,
title = {CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection},
author = {Qingyu Zhang and Puzhuo Liu and Peng Di and Chenxiong Qian},
journal= {arXiv preprint arXiv:2511.19875},
year = {2025}
}