中文

GeneralThinker:通过似然引导的答案条件优化实现领域通用推理

计算与语言 2026-05-28 v1

摘要

基于可验证奖励的强化学习提升了语言模型的推理能力,但其对领域特定验证器、稀疏结果奖励和粗粒度信用分配的依赖限制了其适用性。我们提出了GeneralThinker,一个在线策略框架,它将推理监督重新表述为密集的答案条件优化,从而无需领域特定验证器即可实现响应级评估和令牌级信用分配。GeneralThinker使用真实答案的似然性来评估生成的推理轨迹,并推导出令牌级兼容性信号以进行细粒度信用分配。为了稳定优化,它通过裁剪和方向保持调制来约束令牌级更新。在涵盖数学、STEM和通用推理的11个基准测试中,GeneralThinker取得了最佳平均性能。进一步分析表明,不受控的令牌级调制会破坏训练稳定性,而受控的调制则使细粒度信用分配持续有效。

关键词

引用

@article{arxiv.2605.27934,
  title  = {GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization},
  author = {Shengmin Piao and Sanghyun Park},
  journal= {arXiv preprint arXiv:2605.27934},
  year   = {2026}
}