中文

探索 RLVR 中用于 Token 级和展开级控制的多温度策略

计算与语言 2025-10-13 v1 人工智能

摘要

强化学习已在大语言模型(LLMs)的推理能力方面展示了显著改进,在各个领域展现出重大适用性。近期研究识别出 LLM 中的标记在推理任务中扮演不同角色,将它们分类为高熵推理标记和低熵知识标记。先前的 approaches 通常专注于通过限制更新间接鼓励探索,但它们并未在标记生成阶段本身明确促进探索行为。在本工作中,我们引入一种互补方法,通过为不同标记类型应用不同温度设置来在采样过程中明确促进探索。具体而言,我们的方法对推理标记使用较高温度以积极鼓励探索,同时对知识标记保留较低温度以保持事实正确性。此外,我们系统地研究了多温度调度策略及其在强化学习语境中的影响。在多个推理基准上的经验评估表明,我们的方法显著增强了大语言模型的推理能力。代码可在 https://github.com/zhmzm/Multi_Temperature_Verl.git 获取。

关键词

引用

@article{arxiv.2510.08892,
  title  = {Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR},
  author = {Haomin Zhuang and Yujun Zhou and Taicheng Guo and Yue Huang and Fangxu Liu and Kai Song and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2510.08892},
  year   = {2025}
}