中文

通过自适应抗命弥合模仿鸿沟

机器学习 2021-12-06 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

在实践中,只要能够设计一个提供专家监督的教学智能体,模仿学习就优于纯强化学习。然而,我们表明,当教学智能体在可访问学生无法获得的特权信息的情况下做决策时,该信息在模仿学习过程中被边缘化,导致“模仿鸿沟”并可能产生糟糕的结果。先前工作通过从模仿学习到强化学习的渐进过程来弥合此鸿沟。尽管常获成功,渐进过程对于需要频繁在探索与记忆之间切换的任务会失败。为了更好地解决这些任务并缓解模仿鸿沟,我们提出“自适应抗命”(ADVISOR)。ADVISOR在训练期间动态加权模仿与基于奖励的强化学习损失,从而实现模仿与探索的即时切换。在网格世界、多智能体粒子环境和高保真3D模拟器中的一组挑战性任务上,我们表明ADVISOR的即时切换优于纯模仿、纯强化学习以及它们的顺序与并行组合。

关键词

引用

@article{arxiv.2007.12173,
  title  = {Bridging the Imitation Gap by Adaptive Insubordination},
  author = {Luca Weihs and Unnat Jain and Iou-Jen Liu and Jordi Salvador and Svetlana Lazebnik and Aniruddha Kembhavi and Alexander Schwing},
  journal= {arXiv preprint arXiv:2007.12173},
  year   = {2021}
}

备注

NeurIPS'21 version. The first two authors contributed equally. Project page: https://unnat.github.io/advisor/