中文

基于杠杆逐元素矩阵估计的无模型低秩强化学习

机器学习 2024-11-12 v2

摘要

我们考虑在具有低秩潜在结构的受控动力学系统中学习一个ε-最优策略的问题。针对此问题,我们提出了LoRa-PI(低秩策略迭代),一种在策略改进和策略评估步骤之间交替进行的无模型学习算法。在策略评估步骤中,该算法使用以下两阶段过程来估计与当前策略的(状态,动作)值函数相对应的低秩矩阵。首先,对矩阵的条目进行均匀随机采样,以通过谱方法估计其行和列的杠杆分数。然后,利用这些分数提取少数重要的行和列,并对其条目进行进一步采样。该算法利用这些新样本,采用类似CUR的方法完成矩阵估计。对于这种杠杆矩阵估计过程,我们建立了逐元素保证,值得注意的是,这些保证不依赖于矩阵的相干性,而仅依赖于其尖峰性。这些保证意味着LoRa-PI使用O~(S+Apoly(1γ)ε2)\widetilde{O}({S+A\over \mathrm{poly}(1-\gamma)\varepsilon^2})个样本即可学习到一个ε-最优策略,其中SS(或AA)表示状态(或动作)的数量,γ\gamma为折扣因子。与先前提出的方法所假设的条件相比,我们的算法在更温和的条件下实现了这种(在SSAAε\varepsilon上)阶数最优的样本复杂度。

关键词

引用

@article{arxiv.2410.23434,
  title  = {Model-free Low-Rank Reinforcement Learning via Leveraged Entry-wise Matrix Estimation},
  author = {Stefan Stojanovic and Yassir Jedra and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:2410.23434},
  year   = {2024}
}

备注

Accepted for presentation at the Conference on Neural Information Processing Systems (NeurIPS) 2024