中文

长视野强化学习比短视野强化学习更困难吗?

机器学习 2020-07-10 v2 人工智能 最优化与控制 机器学习

摘要

学习为长视野做规划是情节式强化学习问题的核心挑战。一个基本问题是理解问题难度如何随视野增加而缩放。此处样本复杂度的自然度量是归一化度量:我们关注以高置信发现价值与最优价值相差 ε\varepsilon 之策略所需的情节数,其中价值由每情节归一化累积奖励度量。在 COLT 2018 开放问题中,Jiang 与 Agarwal 猜想:对表格型情节式强化学习问题,存在展现对视野多项式依赖的样本复杂度下界——该猜想与所有已知样本复杂度上界一致。本工作反驳此猜想,证明表格型情节式强化学习可以仅以随规划视野对数缩放的样本复杂度实现。换言之,当价值被适当归一化(落于单位区间)时,该结果表明至少在极小极大意义下长视野 RL 不比短视野 RL 更困难。我们的分析引入两点: (i) 为最优策略构造 ε\varepsilon-网,其对数覆盖数仅随规划视野对数缩放; (ii) Online Trajectory Synthesis 算法,其以随给定策略类对数覆盖数缩放的样本复杂度自适应评估给定策略类中所有策略。两者均可能具有独立意义。

关键词

引用

@article{arxiv.2005.00527,
  title  = {Is Long Horizon Reinforcement Learning More Difficult Than Short Horizon Reinforcement Learning?},
  author = {Ruosong Wang and Simon S. Du and Lin F. Yang and Sham M. Kakade},
  journal= {arXiv preprint arXiv:2005.00527},
  year   = {2020}
}