中文

基于最大熵调节的长链思考方法对 LLM 进行微调以分析代码审查的多个维度

软件工程 2025-09-26 v1 人工智能

摘要

大型语言模型(LLM)在因其在上下文理解和推理方面的卓越能力显示出在自动化代码审查中的巨大潜力。然而, 这些能力仍受限于训练数据的影响, 与人类水平的认知能力相比仍有不足。最近的研究表明, 通过使用代码审查数据对 LLM 进行微调可显著提升性能。然而, 与人类审查员通常同时分析多个维度以更好地识别问题的做法相比, 这些方法的潜力受到有限或模糊信息用于微调的限制。本文贡献了 MelcotCR, 一种基于链式思考(COT)的微调方法, 通过运用长 COT 技术提供丰富的结构化信息来训练具备出色推理能力的 LLM 能够分析代码审查的多个维度。为解决 LLM 处理长 COT 提示时经常出现的上下文丢失和推理逻辑丢失问题, 我们提出了一种结合最大熵(ME)建模原则与 MelcotCR 中预定义推理路径的解决方案, 以在长 COT 提示中更有效地利用上下文知识,同时加强推理过程的逻辑紧凑性。在我们的精选 MelcotCR 数据集和公共 CodeReviewer 数据集上的经验评估表明, 一个低参数基模型(如 14B Qwen2.5)经 MelcotCR 微调后, 在代码问题检测与描述准确性方面可超过最先进的方法, 其性能在相当程度上与 671B DeepSeek-R1 模型持平。

关键词

引用

@article{arxiv.2509.21170,
  title  = {Fine-Tuning LLMs to Analyze Multiple Dimensions of Code Review: A Maximum Entropy Regulated Long Chain-of-Thought Approach},
  author = {Yongda Yu and Guohao Shi and Xianwei Wu and Haochuan He and XueMing Gu and Qianqian Zhao and Kui Liu and Qiushi Wang and Zhao Tian and Haifeng Shen and Guoping Rong},
  journal= {arXiv preprint arXiv:2509.21170},
  year   = {2025}
}

备注

22 pages