中文

监督乐观校正:在大语言模型确信时保持自信

计算与语言 2025-06-03 v2

摘要

在这项工作中,我们在token级马尔可夫决策过程下建立了监督微调与离线强化学习之间的新颖理论联系,揭示了大语言模型确实学习了一个隐式的Q函数用于推理。通过这一理论视角,我们证明了广泛使用的束搜索方法存在不可接受的过度乐观,其中由于次优步骤的Q值估计膨胀,推理误差不可避免地放大。为了解决这一局限性,我们提出了监督乐观校正(SOC),它在监督微调期间引入了一个简单而有效的辅助损失用于token级Q值估计。具体来说,该辅助损失采用隐式值正则化来增强模型对专家演示响应的置信度,从而抑制对监督不足响应的过度乐观。在数学推理基准(包括GSM8K、MATH和GAOKAO)上的大量实验展示了所提出的SOC与束搜索在一系列开源模型上的优越性。

关键词

引用

@article{arxiv.2504.07527,
  title  = {Supervised Optimism Correction: Be Confident When LLMs Are Sure},
  author = {Junjie Zhang and Rushuai Yang and Shunyu Liu and Ting-En Lin and Fei Huang and Yi Chen and Yongbin Li and Dacheng Tao},
  journal= {arXiv preprint arXiv:2504.07527},
  year   = {2025}
}