中文

剩余必为真:过滤驱动的 LLM 推理,塑造多样性

机器学习 2026-03-09 v2 人工智能

摘要

强化学习(RL)已成为微调大语言模型以解决推理任务的事实标准。然而,越来越多的证据表明,这类训练方式会导致模型在多样性方面出现显著损失。我们认为,这源于 RL 隐式地对目标分布进行“模式寻求”或“零强制”型的逆 KL 优化,使得模型集中资源于目标分布的某些高概率区域,忽略其他区域。在本工作中,我们从显式的目标分布开始,通过过滤错误答案而保留正确答案的相对概率来构建目标分布。以预训练的 LLM 为起点,我们使用 α\alpha-divergence 族来近似该目标分布,该方法统一了先前方法,能够通过在模式寻求与覆盖型 divergence 之间插值,直接控制精度-多样性权衡。在一个 Lean 定理证明基准上,我们的方法在覆盖-精度 Pareto 前沿上实现了领先性能, 在覆盖轴上超越了所有先前方法。

关键词

引用

@article{arxiv.2512.05962,
  title  = {Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity},
  author = {Germán Kruszewski and Pierre Erbacher and Jos Rozen and Marc Dymetman},
  journal= {arXiv preprint arXiv:2512.05962},
  year   = {2026}
}

备注

Published as an ICLR 2026 conference paper