中文

离线强化学习中探索的挑战

机器学习 2022-02-22 v2

摘要

离线强化学习(ORL)使我们能够分别研究强化学习的两个相互关联的过程:收集信息性经验与推断最优行为。第二步在离线设定中已被广泛研究,但对于数据高效RL同样关键的是收集信息性数据。任务不可知的数据收集设定(即任务事先未知)尤其令人关注,因为有可能收集单一数据集并在后续任务出现时用以解决多个下游任务。我们通过基于好奇心的内在激励研究该设定,这是一类鼓励智能体探索其尚未学会建模的状态或转移的探测方法。借助Explore2Offline,我们提出通过转移所收集数据并利用奖励重标和标准离线RL算法推断策略来评估所收集数据的质量。我们利用该方案评估了多种数据收集策略,包括一种新探索智能体——内在模型预测控制(IMPC),并展示了它们在各类任务上的性能。我们利用这种解耦框架来强化关于探索以及有效离线RL的数据前置条件的直觉。

关键词

引用

@article{arxiv.2201.11861,
  title  = {The Challenges of Exploration for Offline Reinforcement Learning},
  author = {Nathan Lambert and Markus Wulfmeier and William Whitney and Arunkumar Byravan and Michael Bloesch and Vibhavari Dasagi and Tim Hertweck and Martin Riedmiller},
  journal= {arXiv preprint arXiv:2201.11861},
  year   = {2022}
}