基于杠杆逐元素矩阵估计的无模型低秩强化学习
机器学习
2024-11-12 v2
摘要
我们考虑在具有低秩潜在结构的受控动力学系统中学习一个ε-最优策略的问题。针对此问题,我们提出了LoRa-PI(低秩策略迭代),一种在策略改进和策略评估步骤之间交替进行的无模型学习算法。在策略评估步骤中,该算法使用以下两阶段过程来估计与当前策略的(状态,动作)值函数相对应的低秩矩阵。首先,对矩阵的条目进行均匀随机采样,以通过谱方法估计其行和列的杠杆分数。然后,利用这些分数提取少数重要的行和列,并对其条目进行进一步采样。该算法利用这些新样本,采用类似CUR的方法完成矩阵估计。对于这种杠杆矩阵估计过程,我们建立了逐元素保证,值得注意的是,这些保证不依赖于矩阵的相干性,而仅依赖于其尖峰性。这些保证意味着LoRa-PI使用个样本即可学习到一个ε-最优策略,其中(或)表示状态(或动作)的数量,为折扣因子。与先前提出的方法所假设的条件相比,我们的算法在更温和的条件下实现了这种(在、和上)阶数最优的样本复杂度。
引用
@article{arxiv.2410.23434,
title = {Model-free Low-Rank Reinforcement Learning via Leveraged Entry-wise Matrix Estimation},
author = {Stefan Stojanovic and Yassir Jedra and Alexandre Proutiere},
journal= {arXiv preprint arXiv:2410.23434},
year = {2024}
}
备注
Accepted for presentation at the Conference on Neural Information Processing Systems (NeurIPS) 2024