模仿者学习:在可变环境中实现开箱即用的模仿能力
机器学习
2023-10-10 v1
摘要
模仿学习(IL)使智能体能够模仿专家行为。以往多数 IL 技术侧重于通过大量演示精确模仿单一策略。然而在许多应用中,人类所需的是借助相应任务的少量演示直接执行多样任务的能力,而智能体部署时会遭遇诸多意外变化。此场景下,期望智能体不仅模仿演示,还能适应未预见的环境变化。这促使我们提出称为模仿者学习(ItorL)的新课题,旨在导出一种模仿者模块,可基于针对不同未见任务的极少量专家演示即时重构模仿策略,无需任何额外调整。本文聚焦于仅基于单条专家演示的模仿者学习。为求解 ItorL,我们提出演示注意力 actor-critic(DAAC),将 IL 整合进强化学习范式以规范策略在意外情形下的行为。此外,为自主构建模仿策略,我们设计了基于演示的注意力架构用于模仿者策略,可通过自适应追踪演示中合适状态有效输出模仿动作。我们为 \topic~开发了新型导航基准与机器人环境,并表明 DAAC~在已见与未见任务上均大幅优于既往模仿方法。
引用
@article{arxiv.2310.05712,
title = {Imitator Learning: Achieve Out-of-the-Box Imitation Ability in Variable Environments},
author = {Xiong-Hui Chen and Junyin Ye and Hang Zhao and Yi-Chen Li and Haoran Shi and Yu-Yan Xu and Zhihao Ye and Si-Hang Yang and Anqi Huang and Kai Xu and Zongzhang Zhang and Yang Yu},
journal= {arXiv preprint arXiv:2310.05712},
year = {2023}
}