一种面向动力学失配迁移学习的观测模仿方法
人工智能
2021-01-26 v3 机器学习
摘要
我们研究了将源环境中学习到的策略迁移到具有不同动力学的目标环境的问题,特别是在学习过程中减少与目标环境交互次数至关重要的情况下。该问题在模拟到真实的迁移中尤为重要,因为模拟器不可避免地会对真实世界动力学建模不完善。在本文中,我们表明该迁移问题的一种现有解决方案——基于基元的动作变换(grounded action transformation)——与观测模仿(IfO)问题密切相关:即学习模仿行为演示观测值的行为。在建立这一关系后,我们假设IfO文献中近期最先进的方法可有效转用于基于基元的迁移学习。为验证我们的假设,我们基于对抗性观测模仿技术推导出一种新算法——生成对抗强化动作变换(GARAT)。我们在多个具有动力学失配的领域中进行了实验,发现使用GARAT训练的智能体在目标环境中相比现有黑盒迁移方法获得了更高的回报。
引用
@article{arxiv.2008.01594,
title = {An Imitation from Observation Approach to Transfer Learning with Dynamics Mismatch},
author = {Siddharth Desai and Ishan Durugkar and Haresh Karnan and Garrett Warnell and Josiah Hanna and Peter Stone},
journal= {arXiv preprint arXiv:2008.01594},
year = {2021}
}