中文

价值改进路径:迈向强化学习的更好表征

机器学习 2021-01-05 v2 机器学习

摘要

在基于价值的强化学习(RL)中,与监督学习不同,智能体面对的不是单一的、静止的近似问题,而是一系列价值预测问题。每次策略改进时,问题的性质都会改变,从而同时改变状态分布及其价值。在本文中我们采取一种新颖的视角,认为 RL 智能体所面对的价值预测问题不应被孤立地处理,而应作为一个单一的、整体的预测问题。RL 算法生成一系列策略,这些策略至少近似地朝着最优策略改进。我们明确刻画了相关的价值函数序列,并称其为价值改进路径。我们的主要思想是整体地近似价值改进路径,而不是仅仅跟踪当前策略的价值函数。具体而言,我们讨论了 RL 的这种整体视角对表征学习的影响。我们证明,跨越过去价值改进路径的表征也将为未来的策略改进提供准确的价值近似。我们利用这一见解来更好地理解现有的辅助任务方法并提出新的方法。为了在经验上检验我们的假设,我们为标准深度 RL 智能体增加了一个学习价值改进路径的辅助任务。在 Atari 2600 游戏的研究中,增强型智能体达到了基线智能体均值和中位数性能约两倍的表现。

关键词

引用

@article{arxiv.2006.02243,
  title  = {The Value-Improvement Path: Towards Better Representations for Reinforcement Learning},
  author = {Will Dabney and André Barreto and Mark Rowland and Robert Dadashi and John Quan and Marc G. Bellemare and David Silver},
  journal= {arXiv preprint arXiv:2006.02243},
  year   = {2021}
}

备注

AAAI-21