CARE-RFT:面向大语言模型可靠推理的置信锚定强化微调
机器学习
2026-02-03 v1 人工智能
计算与语言
摘要
强化微调(RFT)已成为解锁大语言模型推理能力的强大范式。然而,我们发现了一个关键的权衡:无约束的RFT虽然实现了强大的推理性能,但会通过放大幻觉和恶化校准来严重损害模型可信度;相反,RKL约束的RFT保留了可信度,但由于其对探索性偏差的无界惩罚而限制了推理增益。为解决这一矛盾,我们引入了CARE-RFT(置信锚定正则化强化微调),一种用偏斜反向KL散度替代标准反向KL正则化的新方法。CARE-RFT提供了一种置信度敏感的惩罚:对于自信且持续获得奖励的探索,惩罚有界以促进推理;而在其他情况下惩罚无界以保持校准。跨多个模型规模和RFT算法的大量实验表明,CARE-RFT实现了卓越的平衡,在匹配无约束RFT推理性能的同时,恢复了基础模型的可信度和校准。我们的工作表明,谨慎的、置信度感知的正则化是构建既强大又可信的推理模型的关键。
引用
@article{arxiv.2602.00085,
title = {CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models},
author = {Shuozhe Li and Jincheng Cao and Bodun Hu and Aryan Mokhtari and Leqi Liu and Amy Zhang},
journal= {arXiv preprint arXiv:2602.00085},
year = {2026}
}