连通性对强化学习中拉普拉斯表示的影响
机器学习
2026-05-12 v2 机器学习
摘要
在马尔可夫决策过程(MDP)中学习紧凑状态表示,对解决大规模强化学习(RL)问题中的维度灾难至关重要。现有方法通过在MDP上构建结构性先验,使状态表示作为状态图拉普拉斯特征向量的线性组合。当状态图未知或状态空间庞大时,可直接通过样本轨迹估计图谱特征。本文给出线性值函数近似误差的上界,证明该误差随状态图的代数连通性而扩展,将近似质量置于MDP拓扑结构之内。我们进一步界定特征向量估计本身引入的误差,形成表示学习管道的端到端误差分解。此外,我们的拉普拉斯算子表达式虽等价于现有方法,却可防止某些常见误解,并举例说明文献中的误区。我们的结果适用于一般(非均匀)策略,不对诱导转移核的对称性作任何假设。我们通过网格世界环境的数值仿真验证了理论结论。
引用
@article{arxiv.2603.08558,
title = {Impact of Connectivity on Laplacian Representations in Reinforcement Learning},
author = {Tommaso Giorgi and Pierriccardo Olivieri and Keyue Jiang and Laura Toni and Matteo Papini},
journal= {arXiv preprint arXiv:2603.08558},
year = {2026}
}