中文

良好的表示本身是否足以实现样本高效的强化学习?

机器学习 2020-03-02 v4 人工智能 最优化与控制 机器学习

摘要

现代深度学习方法提供了学习良好表示的有效手段。然而,良好的表示本身是否足以实现样本高效的强化学习?这一问题主要在更经典的近似动态规划文献中仅就(最坏情况)近似误差被研究。在统计视角下,该问题很大程度上未被探索,且现有文献主要关注允许样本高效强化学习的条件,而很少理解什么是高效强化学习的必要条件。本工作表明,从统计视角看,情况远比更传统的近似视角所暗示的微妙,其中足以实现样本高效 RL 的表示要求甚至更为严格。我们的主要结果给出了强化学习方法的尖锐阈值,表明在良好函数近似(就表示的维数而言)上存在硬性限制,我们聚焦于与基于价值、基于模型和基于策略的学习相关的自然表示条件。这些下界强调,拥有良好的(基于价值、基于模型或基于策略的)表示本身不足以实现高效强化学习,除非该近似的质量超过某些硬性阈值。此外,我们的下界还意味着以下之间的样本复杂度指数级分离:1) 具有完美表示的基于价值学习与具有良好但非完美表示的基于价值学习,2) 基于价值学习与基于策略学习,3) 基于策略学习与监督学习,以及 4) 强化学习与模仿学习。

关键词

引用

@article{arxiv.1910.03016,
  title  = {Is a Good Representation Sufficient for Sample Efficient Reinforcement Learning?},
  author = {Simon S. Du and Sham M. Kakade and Ruosong Wang and Lin F. Yang},
  journal= {arXiv preprint arXiv:1910.03016},
  year   = {2020}
}

备注

To appear in ICLR 2020