中文

用于强化学习的潜变量表示

机器学习 2023-03-08 v2 机器学习

摘要

深度潜变量模型因其在建模复杂转移动力学方面的表达能力,在基于模型的强化学习(RL)中取得了显著的实证成功。另一方面,潜变量模型如何从理论上和经验上促进学习、规划与探索以提高RL的样本效率,仍不清楚。在本文中,我们提供了状态-动作值函数的潜变量模型的表示视角,其允许在不确定性下进行探索时既实现易处理的变分学习算法,又有效实施乐观/悲观原则。特别地,我们通过结合潜变量模型的核嵌入,提出了一种具有UCB探索的计算高效规划算法。理论上,我们建立了所提方法在线上与离线设定下的样本复杂度。在经验上,我们在多个基准上展示了优于当前最先进算法的性能。

关键词

引用

@article{arxiv.2212.08765,
  title  = {Latent Variable Representation for Reinforcement Learning},
  author = {Tongzheng Ren and Chenjun Xiao and Tianjun Zhang and Na Li and Zhaoran Wang and Sujay Sanghavi and Dale Schuurmans and Bo Dai},
  journal= {arXiv preprint arXiv:2212.08765},
  year   = {2023}
}

备注

ICLR 2023. The first two authors contribute equally. Project Website: https://rlrep.github.io/lvrep/