为何推理模型会丢失覆盖率?数据与道路分支的作用
机器学习
2026-05-19 v1
摘要
近期大型语言模型的进展导致推理模型的出现,这些模型通过专门的微调程序在复杂任务上展现出强大的性能。虽然这些方法可靠地提高了 pass@1 准确率,但先前的工作观察到它们显示出覆盖率收缩行为,即 pass@k 相对于基础模型恶化。在本文中,我们调查 SFT 基于的后训练中的推理收缩现象。我们假设,这一行为是由微调数据的属性驱动的, Specifically 与决策点或“道路分支”情景相关,其中模型面临难以解码的模式且存在多个有效的推理路径。为测试此假设,我们设计了受控案例研究来模拟此类决策点情景,涵盖图分支中的难以解码节点和推理模式。通过跟踪这些情景下的后训练动力学,我们发现收缩现象与决策点情景在训练数据中的存在率紧密相关。我们还展示了通过针对决策点的有针对性数据合成设计以及更系统的多样性鼓励解码机制,部分缓解了这种收缩行为。我们的发现确定了数据中心因素是推理模型收缩的关键驱动因素,并突出了多样性感知设计作为控制其有效杠杆。
引用
@article{arxiv.2605.17026,
title = {Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road},
author = {Ngoc-Hieu Nguyen and Parshin Shojaee and Phuc Minh Nguyen and Nan Zhang and Chandan K Reddy and Khoa D Doan and Rui Zhang},
journal= {arXiv preprint arXiv:2605.17026},
year = {2026}
}
备注
22 pages, 13 figures