基于能量的模仿学习
机器学习
2021-04-16 v4 机器学习
摘要
我们处理模仿学习(IL)中的一种常见场景:智能体试图从专家示范中恢复最优策略,而无法进一步访问专家或环境奖励信号。除了采用监督学习并随之带来复合误差问题的简单行为克隆(BC)外,先前的逆强化学习(IRL)及近期生成对抗方法都涉及用于更新奖励函数与策略的双层或交替优化,饱受高计算成本与训练不稳定之苦。受基于能量的模型(EBM)近期进展启发,本文提出一种简化的IL框架,名为基于能量的模仿学习(EBIL)。EBIL不再迭代更新奖励与策略,而是通过简单灵活的两阶段方案打破传统IRL范式:首先通过分数匹配估计专家能量作为替代奖励函数,继而利用该奖励通过强化学习算法学习策略。EBIL结合了EBM与占据测度匹配的思想,且通过理论分析我们揭示EBIL与最大熵IRL(MaxEnt IRL)方法实为一枚硬币的两面,因此EBIL可作为对抗式IRL方法的替代。定性与定量评估的广泛实验表明,EBIL能够恢复有意义且可解释的奖励信号,同时在IL基准上取得与现有算法相当的有效性能。
引用
@article{arxiv.2004.09395,
title = {Energy-Based Imitation Learning},
author = {Minghuan Liu and Tairan He and Minkai Xu and Weinan Zhang},
journal= {arXiv preprint arXiv:2004.09395},
year = {2021}
}
备注
Correct minor errors. 15 pages (6 pages of supplementary), 8 figures, Accepted by AAMAS-2021