GeneralThinker:通过似然引导的答案条件优化实现领域通用推理
计算与语言
2026-05-28 v1
摘要
基于可验证奖励的强化学习提升了语言模型的推理能力,但其对领域特定验证器、稀疏结果奖励和粗粒度信用分配的依赖限制了其适用性。我们提出了GeneralThinker,一个在线策略框架,它将推理监督重新表述为密集的答案条件优化,从而无需领域特定验证器即可实现响应级评估和令牌级信用分配。GeneralThinker使用真实答案的似然性来评估生成的推理轨迹,并推导出令牌级兼容性信号以进行细粒度信用分配。为了稳定优化,它通过裁剪和方向保持调制来约束令牌级更新。在涵盖数学、STEM和通用推理的11个基准测试中,GeneralThinker取得了最佳平均性能。进一步分析表明,不受控的令牌级调制会破坏训练稳定性,而受控的调制则使细粒度信用分配持续有效。
引用
@article{arxiv.2605.27934,
title = {GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization},
author = {Shengmin Piao and Sanghyun Park},
journal= {arXiv preprint arXiv:2605.27934},
year = {2026}
}