先移位再学习:强化学习中的低秩表示
机器学习
2025-11-06 v2
摘要
低秩结构是许多现代强化学习(RL)算法中常见的隐含假设。例如,无奖励和目标条件 RL 方法通常假定后继测度具有低秩表示。在本文中,我们挑战了这一假设,首先指出后继测度本身并非近似低秩。相反,我们证明低秩结构自然出现在移位后继测度中,该测度捕获了绕过少量初始转换后的系统动力学。我们为从采样条目估计移位后继测度的逐元素低秩近似提供了有限样本性能保证。我们的分析揭示,近似误差和估计误差主要由一个新引入的量主导:对应矩阵的谱可恢复性。为了界定该参数,我们推导了马尔可夫链的一类新泛函不等式——II 型庞加莱不等式——由此可量化有效低秩近似和估计所需的移位量。该分析表明,所需移位量取决于移位后继测度的高阶奇异值的衰减,因此在实践中通常较小。此外,我们建立了必要移位与底层动力系统局部混合特性之间的联系,这为选择移位提供了一种自然方式。最后,我们通过实验验证了理论发现,并证明移位后继测度确实能提升目标条件 RL 的性能。
引用
@article{arxiv.2509.05193,
title = {Shift Before You Learn: Enabling Low-Rank Representations in Reinforcement Learning},
author = {Bastien Dubail and Stefan Stojanovic and Alexandre Proutière},
journal= {arXiv preprint arXiv:2509.05193},
year = {2025}
}
备注
63 pages, 11 figures. Accepted to NeurIPS 2025 (Spotlight)