中文

用于语言模型通用推理的耦合变分强化学习

计算与语言 2026-05-26 v3 人工智能

摘要

尽管强化学习在语言模型推理方面取得了令人瞩目的进展,但其受限于可验证奖励的需求。近期无验证器强化学习方法通过利用大语言模型生成参考答案的概率作为奖励信号来解决这一限制。然而,这些方法通常仅在问题的条件下采样推理轨迹。该设计将推理轨迹采样与答案信息解耦,导致轨迹与最终答案之间探索效率低下且不一致。在本文中,我们提出了耦合变分强化学习(CoVRL),它通过混合采样策略将先验分布与后验分布耦合,从而桥接变分推断与强化学习。通过构建和优化整合这两种分布的复合分布,CoVRL在保持强思维-答案一致性的同时实现了高效探索。在数学和通用推理基准上的大量实验表明,CoVRL相较于基础模型将性能提升了12.4%,相较于最先进的基线无验证器强化学习方法取得了额外2.3%的提升,为增强语言模型的通用推理能力提供了一个原则性框架。

关键词

引用

@article{arxiv.2512.12576,
  title  = {Coupled Variational Reinforcement Learning for Language Model General Reasoning},
  author = {Xueru Wen and Jie Lou and Yanjiang Liu and Hongyu Lin and Ben He and Xianpei Han and Le Sun and Yaojie Lu and Debing Zhang},
  journal= {arXiv preprint arXiv:2512.12576},
  year   = {2026}
}

备注

Accepted to ICML 2026