中文

检索增强的强化学习

机器学习 2022-05-25 v4

摘要

大多数深度强化学习(RL)算法通过梯度更新将经验提炼为参数化行为策略或价值函数。尽管有效,该方法有几个缺点:(1)计算开销大,(2)需要多次更新才能将经验整合进参数化模型,(3)未完全整合的经验不会恰当地影响智能体行为,(4)行为受模型容量限制。本文探索一种替代范式:训练一个网络将过往经验数据集映射到最优行为。具体而言,我们为 RL 智能体增强一个检索过程(参数化为神经网络),该过程可直接访问经验数据集。该数据集可来自智能体过往经验、专家示范或任何其他相关来源。检索过程被训练为从数据集中检索当前上下文可能有用的信息,以帮助智能体更快、更高效地实现目标。所提方法便于学习在测试时能将行为建立在整个数据集上、而非仅当前状态或当前轨迹上的智能体。我们将方法集成到两种不同的 RL 智能体中:离线 DQN 智能体和在线 R2D2 智能体。在离线多任务问题中,我们表明检索增强的 DQN 智能体避免了任务干扰,并比基线 DQN 智能体学习更快。在 Atari 上,我们表明检索增强的 R2D2 比基线 R2D2 学习显著更快且取得更高分数。我们进行了大量消融实验以衡量所提方法各组件的贡献。

关键词

引用

@article{arxiv.2202.08417,
  title  = {Retrieval-Augmented Reinforcement Learning},
  author = {Anirudh Goyal and Abram L. Friesen and Andrea Banino and Theophane Weber and Nan Rosemary Ke and Adria Puigdomenech Badia and Arthur Guez and Mehdi Mirza and Peter C. Humphreys and Ksenia Konyushkova and Laurent Sifre and Michal Valko and Simon Osindero and Timothy Lillicrap and Nicolas Heess and Charles Blundell},
  journal= {arXiv preprint arXiv:2202.08417},
  year   = {2022}
}