中文

基于判别器加权的次优演示离线模仿学习

机器学习 2022-07-21 v1 人工智能

摘要

我们研究离线模仿学习(IL)问题,其中智能体旨在学习最优专家行为策略而无需额外的在线环境交互。相反,智能体获得一个来自次优行为的补充离线数据集。解决该问题的先前工作要么要求专家数据占据离线数据集的多数比例,要么需要学习奖励函数并随后执行离线强化学习(RL)。本文中,我们旨在解决演示包含大量次优数据时无需奖励学习和离线RL训练额外步骤的问题。基于行为克隆(BC),我们引入一个额外的判别器来区分专家与非专家数据。我们提出一个协作框架来提升两项任务的学习。基于该框架,我们设计了一种新的IL算法,其中判别器的输出作为BC损失的权重。实验结果表明,与基线算法相比,我们提出的算法获得了更高的回报和更快的训练速度。

关键词

引用

@article{arxiv.2207.10050,
  title  = {Discriminator-Weighted Offline Imitation Learning from Suboptimal Demonstrations},
  author = {Haoran Xu and Xianyuan Zhan and Honglei Yin and Huiling Qin},
  journal= {arXiv preprint arXiv:2207.10050},
  year   = {2022}
}

备注

ICML 2022, code at https://github.com/ryanxhr/DWBC