差分平滑缓解锐化现象并提升大语言模型推理能力
机器学习
2025-12-12 v2
摘要
众所周知,大语言模型的强化学习微调常导致多样性崩溃,即输出缺乏多样性。先前的工作提出了各种启发式方法来抵消这一效应,但这些方法不成熟:它们常在正确性与多样性之间进行权衡,效果在不同任务间变化,且在某些情况下甚至相互矛盾。本文在严格的理论基础上阐明这些观察。我们首先形式化地证明了 RL 微调为何产生多样性崩溃——这是由于选择偏差和强化偏差。随后,我们提出了一个关键观察:仅需针对正确的轨迹上应用奖励修改,即可解决多样性崩溃问题。基于此分析,我们引入一种原则方法——差分平滑——可在正确性和多样性之间取得双提升,超越普通 RL 以及广泛使用的熵基启发式方法。我们的理论精确刻画了现有启发式方法的有效性条件及其失效原因,同时表明差分平滑具有普适优势。大规模实验覆盖 1B至7B 参数的模型,涵盖计数器和真实数学推理等领域,结果显示方法始终取得提升。差分平滑在 Pass@1 和 Pass@k 指标上均取得提升,在 AIME24 数据集上提升幅度可达 6.7%。
引用
@article{arxiv.2511.19942,
title = {Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning},
author = {Jingchu Gai and Guanning Zeng and Huaqing Zhang and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2511.19942},
year = {2025}
}