中文

低维子空间中的学习:强化学习的正交瓶颈

机器学习 2026-05-26 v1 人工智能

摘要

深度强化学习(RL)代理通常依赖于高维神经表征,尽管存在越来越多的证据表明任务相关的价值和策略结构可能本质上是低维的。在本工作中,我们提出一种简单而有效的表示层级先验,通过插入固定的正交投影来约束编码器特征位于低维子空间,这需要无需额外目标、预训练或对底层 RL 算法的修改。在线性可实现性假设下,我们证明当瓶颈维度超过特征空间中最优价值函数的内在秩时,瓶颈保持可表达性,并将诱导的梯度动力学保持不变,最多只是等价的低维参数化。在实验上,我们发现无论是单任务还是多任务基准,只要瓶颈维度超过小的任务相关阈值,基线性能要么保持,要么得到改善;在许多情况下,价值表征可以压缩到极低维度而不损失性能,最小充分维度对环境复杂度的依赖远大于编码器宽度。此外,我们分析了表示几何,发现正交瓶颈稳定特征范数,并与更高的有效秩相关。总的来说,这些结果支持强化学习中流形假设的表示空间解释,并将正交瓶颈定位为一种轻量级、无源的 RL 表示塑造机制。

关键词

引用

@article{arxiv.2605.26012,
  title  = {Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning},
  author = {Aleksandar Todorov and Matthia Sabatelli},
  journal= {arXiv preprint arXiv:2605.26012},
  year   = {2026}
}