中文

柔性选项学习

机器学习 2021-12-07 v1 人工智能

摘要

强化学习(RL)中的时间抽象通过随时间更高效传播信息,有望改善复杂环境中的泛化与知识迁移。尽管选项学习最初以允许同时使用离策略、选项内学习更新多个选项的方式提出(Sutton, Precup & Singh, 1999),但近期许多分层强化学习方法每次仅更新一个正在执行的选项。我们重新审视并在深度强化学习背景下扩展选项内学习,以启用对与当前原始动作选择一致的所有选项进行更新,且不引入任何额外估计。因此,我们的方法可自然地被多数分层 RL 框架采用。当我们将本方法与用于选项发现的 option-critic 算法结合时,在广泛领域中获得了性能与数据效率的显著提升。

关键词

引用

@article{arxiv.2112.03097,
  title  = {Flexible Option Learning},
  author = {Martin Klissarov and Doina Precup},
  journal= {arXiv preprint arXiv:2112.03097},
  year   = {2021}
}

备注

NeurIPS 2021 Spotlight