中文

谱谱 Bellman 方法:统一强化学习中的表示学习与探索

机器学习 2026-02-03 v2

摘要

表示学习是强化学习实现经验与理论成功的关键因素。然而,许多现有方法源自模型学习方面,与实际的强化学习任务存在偏差。本文引入谱谱 Bellman 方法,这是一种源自固有 Bellman 误差(IBE)条件的新型框架。它将表示学习与 Bellman 更新在价值函数可能空间中的基本结构相结合,使其直接适用于基于价值的强化学习。我们的关键洞察是:在零 IBE 条件下,Bellman 算子对价值函数分布的变换与特征协方差结构本质上密切相关。这一联系导致一种新的、在理论上有依据的目标函数,用于学习捕捉该 Bellman 对齐协方差的状态-动作特征,仅需对现有算法进行简单修改。我们展示,所学表示通过将特征协方差与 Bellman 动力学对齐,实现了结构化探索,在困难探索和长时程任务中提升了性能。我们的框架自然扩展到多步 Bellman 算子,为学习更强大且在结构上合理的基于价值强化学习表示提供了原则性路径。

关键词

引用

@article{arxiv.2507.13181,
  title  = {Spectral Bellman Method: Unifying Representation and Exploration in RL},
  author = {Ofir Nabati and Bo Dai and Shie Mannor and Guy Tennenholtz},
  journal= {arXiv preprint arXiv:2507.13181},
  year   = {2026}
}

备注

Accepted to ICLR 2026