通过低秩张量值近似求解有限时域MDP
机器学习
2026-05-14 v3
摘要
我们研究了使用低秩强化学习(RL)方法在有限时域马尔可夫决策过程(MDP)中学习最优策略的问题。在有限时域MDP中,策略以及因此而的值函数(VF)是非平稳的。这加剧了高维MDP的挑战,因为它们 suffer from the curse of dimensionality and high sample complexity。为了解决这些问题,我们提出将有限时域MDP的值函数建模为低秩张量,以实现可扩展的表示,使学习最优策略的问题变得可处理。我们的ethods focuses on VF approximation within a policy iteration framework, where low-rank policy evaluation is combined with greedy policy improvement to compute near-optimal policies。我们引入一种用于求解带低秩约束的贝尔曼方程的优化框架,以及块坐标下降(BCD)和块坐标梯度下降(BCGD)算法,两者都有理论收敛保证。我们进一步证明,有界的低秩策略评估误差在有限时域设置下可转化为有界的策略改进。对于系统动力学未知的情况,我们将所提出的BCGD方法适用于从采样轨迹中估计值函数。数值实验进一步表明,所提出的框架在受控合成场景和更真实的资源分配问题中减少了计算需求,同时在达到的回报方面实现了有竞争力的策略性能。
引用
@article{arxiv.2501.10598,
title = {Addressing Finite-Horizon MDPs via Low-Rank Tensor Value Approximation},
author = {Sergio Rozada and Jose Luis Orejuela and Antonio G. Marques},
journal= {arXiv preprint arXiv:2501.10598},
year = {2026}
}