中文

ReLaX:用于大规模推理模型的潜在探索推理

机器学习 2026-03-23 v2 计算机视觉与模式识别

摘要

基于可验证奖励的强化学习(RLVR)最近在增强大规模推理模型(LRM)的推理能力方面显示出巨大的潜力。然而,RLVR 常常会导致策略趋向过于确定,造成无效的探索和过早的策略收敛。虽然促进 token 级别多样性在缓解熵崩溃方面显示出前景,但我们认为,潜在 dynamics underlying token 生成编码的更丰富的计算结构,对于将策略优化引向更有效的探索-开发权衡至关重要。为使对 LRM 潜在 dynamics 的可行分析和干预成为可能,我们利用库休算子理论获得其隐藏状态动力学的线性化表示。这使我们能够引入动态谱分布(DSD),一种用于量化模型潜在动力学异质性的新指标,作为策略探索的直接指示器。建立在这些基础之上,我们提出了包含潜在动力学以调节策略优化中探索与开发的框架,即 Reasoning with Latent eXploration(ReLaX)。广泛的多模态和文本推理基准测试中的全面实验表明,ReLaX 持续激励推理能力,并优于现有的 token 级别方法。我们的项目已在 https://github.com/ZhangShimin1/ReLaX 上提供。

关键词

引用

@article{arxiv.2512.07558,
  title  = {ReLaX: Reasoning with Latent Exploration for Large Reasoning Models},
  author = {Shimin Zhang and Xianwei Chen and Yufan Shen and Ziyuan Ye and Jibin Wu},
  journal= {arXiv preprint arXiv:2512.07558},
  year   = {2026}
}