中文

面向大型语言模型的代码理解基准

软件工程 2025-07-16 v1 人工智能 计算与语言

摘要

大型语言模型在编码任务(如代码生成和代码完成)方面显示出惊人的能力,因为它们是在大量代码数据上进行训练的。此外,由于核心预训练目标是下一个标记预测,这些模型倾向于学习代码中的表面级语法模式。然而,这并不保证代码理解能力,即捕捉代码语义的能力。在我们看来,这就是为什么这些模型在需要更深层语义理解的任务(如代码调试和代码优化)上表现不佳的原因。为此,我们提出了使用大规模数据集对这些模型进行针对代码理解任务的微调,使其能够更稳健地理解代码语义。我们对三种规模不同的代码模型在一套旨在评估超越表面级语法模式匹配的语义理解任务上的性能进行评估。特别地,我们分析了在主观评分任务上的性能,观察到在针对相关下游任务进行微调后,模型性能得到改善。最显著的改进出现在 QWQ-32B 模型上,其准确率从70%提高到83.47%。其他模型也观察到类似或可解释的趋势,清晰地表明代码理解能力得到了提升。在研究的模型中,DPO 微调的 Codestral-22B 在主观评分任务上实现了最高的微准确率87.66%。

关键词

引用

@article{arxiv.2507.10641,
  title  = {A Code Comprehension Benchmark for Large Language Models for Code},
  author = {Jayant Havare and Saurav Chaudhary and Ganesh Ramakrishnan and Kaushik Maharajan and Srikanth Tamilselvam},
  journal= {arXiv preprint arXiv:2507.10641},
  year   = {2025}
}

备注

10 Pages, 5 Figures