从观测中增强行为克隆
人工智能
2020-04-29 v1
摘要
从观测中模仿是一种计算技术,通过仅观察专家演示中的状态序列来教导智能体如何模仿专家的行为。近期方法通过学习环境逆动力学和模仿策略,并在改变演示数据的同时交替训练两个模型。然而,此类方法常陷入远离专家的次优解,限制了其模仿效果。我们通过一种克服到达不良局部极小值问题的新颖方法来解决该问题:(I) 更好地捕捉状态全局特征的自注意力机制;以及 (ii) 调节用于学习的观测样本的采样策略。我们通过实验证明,我们的方法在四种不同环境中大幅优于最先进的方法。
引用
@article{arxiv.2004.13529,
title = {Augmented Behavioral Cloning from Observation},
author = {Juarez Monteiro and Nathan Gavenski and Roger Granada and Felipe Meneguzzi and Rodrigo Barros},
journal= {arXiv preprint arXiv:2004.13529},
year = {2020}
}
备注
This paper has been accepted in the International Joint Conference on Neural Networks 2020