中文

利用结构进行基于价值的规划与强化学习

机器学习 2020-07-07 v3 机器学习

摘要

基于价值的方法构成了规划与深度强化学习(RL)中的基本方法论。在本文中,我们提出利用状态-动作价值函数(即Q函数)的底层结构,用于规划和深度RL。具体而言,如果底层系统动力学导致Q函数的某些全局结构,则应当能够通过利用此类结构更好地推断该函数。具体地,我们研究了广泛存在于大数据矩阵中的低秩结构。我们在控制和深度RL任务背景下实证验证了低秩Q函数的存在。作为我们的关键贡献,通过利用矩阵估计(ME)技术,我们提出了一个通用框架来利用Q函数中潜在的低秩结构。这导致了经典控制中更高效的规划过程,此外,一个可应用于任何基于价值的RL技术以在“低秩”任务上持续获得更好表现的简单方案。在控制任务和Atari游戏上的大量实验证实了我们的方法的有效性。代码见https://github.com/YyzHarry/SV-RL。

关键词

引用

@article{arxiv.1909.12255,
  title  = {Harnessing Structures for Value-Based Planning and Reinforcement Learning},
  author = {Yuzhe Yang and Guo Zhang and Zhi Xu and Dina Katabi},
  journal= {arXiv preprint arXiv:1909.12255},
  year   = {2020}
}

备注

ICLR 2020 (Oral)