通过自适应抗命弥合模仿鸿沟
机器学习
2021-12-06 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
在实践中,只要能够设计一个提供专家监督的教学智能体,模仿学习就优于纯强化学习。然而,我们表明,当教学智能体在可访问学生无法获得的特权信息的情况下做决策时,该信息在模仿学习过程中被边缘化,导致“模仿鸿沟”并可能产生糟糕的结果。先前工作通过从模仿学习到强化学习的渐进过程来弥合此鸿沟。尽管常获成功,渐进过程对于需要频繁在探索与记忆之间切换的任务会失败。为了更好地解决这些任务并缓解模仿鸿沟,我们提出“自适应抗命”(ADVISOR)。ADVISOR在训练期间动态加权模仿与基于奖励的强化学习损失,从而实现模仿与探索的即时切换。在网格世界、多智能体粒子环境和高保真3D模拟器中的一组挑战性任务上,我们表明ADVISOR的即时切换优于纯模仿、纯强化学习以及它们的顺序与并行组合。
引用
@article{arxiv.2007.12173,
title = {Bridging the Imitation Gap by Adaptive Insubordination},
author = {Luca Weihs and Unnat Jain and Iou-Jen Liu and Jordi Salvador and Svetlana Lazebnik and Aniruddha Kembhavi and Alexander Schwing},
journal= {arXiv preprint arXiv:2007.12173},
year = {2021}
}
备注
NeurIPS'21 version. The first two authors contributed equally. Project page: https://unnat.github.io/advisor/