柔性选项学习
机器学习
2021-12-07 v1 人工智能
摘要
强化学习(RL)中的时间抽象通过随时间更高效传播信息,有望改善复杂环境中的泛化与知识迁移。尽管选项学习最初以允许同时使用离策略、选项内学习更新多个选项的方式提出(Sutton, Precup & Singh, 1999),但近期许多分层强化学习方法每次仅更新一个正在执行的选项。我们重新审视并在深度强化学习背景下扩展选项内学习,以启用对与当前原始动作选择一致的所有选项进行更新,且不引入任何额外估计。因此,我们的方法可自然地被多数分层 RL 框架采用。当我们将本方法与用于选项发现的 option-critic 算法结合时,在广泛领域中获得了性能与数据效率的显著提升。
引用
@article{arxiv.2112.03097,
title = {Flexible Option Learning},
author = {Martin Klissarov and Doina Precup},
journal= {arXiv preprint arXiv:2112.03097},
year = {2021}
}
备注
NeurIPS 2021 Spotlight