中文

CARFT:通过对比学习与注释链式思维强化微调提升大语言模型推理能力

计算与语言 2025-09-09 v2 人工智能

摘要

推理能力在大型语言模型(LLM)的广泛应用中发挥着关键作用。为提升LLM的推理性能,已提出多种基于强化学习(RL)的微调方法,以弥补仅通过监督微调(SFT)训练的LLM在泛化能力上的不足。尽管这些方法有效,但仍存在两个主要局限性:其一,传统RL方法忽略注释链式思维(Chain-of-Thought, CoT),并采用不稳定的推理路径采样,导致模型崩溃、训练过程不稳定及性能次优;其二,现有SFT方法过度强调注释CoT,可能因未充分挖掘潜在CoT而导致性能下降。本文提出一种基于对比学习的注释CoT强化微调方法,即\TheName{},以提升LLM的推理性能并解决上述局限性。具体而言,我们为每条CoT学习表示,并设计新颖的对比信号以引导微调过程。该方法不仅充分挖掘可用注释CoT,还通过纳入额外的无监督学习信号来稳定微调程序。我们针对三个基线方法、两个基础模型和两个数据集进行了全面实验与深入分析,表明\TheName{}在鲁棒性、性能(最高提升10.15%)和效率(最高提升30.62%)方面显著优于现有方法。代码已公开于https://github.com/WNQzhu/CARFT。

关键词

引用

@article{arxiv.2508.15868,
  title  = {CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning},
  author = {Wenqiao Zhu and Ji Liu and Rongjuncheng Zhang and Haipang Wu and Yulun Zhang},
  journal= {arXiv preprint arXiv:2508.15868},
  year   = {2025}
}

备注

14 pages, to appear in EMNLP25