基于后见之明的情景式自我模仿学习
人工智能
2020-11-30 v1 机器人学
摘要
本文提出情景式自我模仿学习,一种带有轨迹选择模块和自适应损失函数的新型自我模仿算法,以加速强化学习。与原始的自我模仿学习算法(从经验回放缓冲区中采样良好的状态-动作对)相比,我们的智能体利用带有后见之明的完整情景来辅助自我模仿学习。引入一个选择模块,从每次更新的每个情景中过滤无信息量的样本。所提方法克服了标准自我模仿学习算法的局限,后者是一种基于转移的方法,在处理具有稀疏奖励的连续控制环境时表现不佳。实验表明,情景式自我模仿学习在策略上优于基线算法,在多个模拟机器人控制任务中达到了与最先进的离策略算法相当的性能。轨迹选择模块被证明可防止智能体学习不良的后见之明经验。凭借解决连续控制设置中稀疏奖励问题的能力,情景式自我模仿学习有潜力应用于具有连续动作空间的现实世界问题,如机器人引导与操控。
引用
@article{arxiv.2011.13467,
title = {Episodic Self-Imitation Learning with Hindsight},
author = {Tianhong Dai and Hengyan Liu and Anil Anthony Bharath},
journal= {arXiv preprint arXiv:2011.13467},
year = {2020}
}