模仿学习中的零样本迁移
机器学习
2023-10-11 v1
摘要
我们提出一种能够学习模仿专家行为且无需重新训练即可迁移至此前未见领域的算法。此类算法在机器人学习等真实世界应用中极为重要,因为 1)奖励函数难以设计,2)从一个领域学到的策略难以部署至另一领域,3)由于安全顾虑,直接在真实世界中学习成本高昂或不可行。为克服这些限制,我们结合深度强化学习的最新进展,使用 AnnealedVAE 学习解耦的状态表示,并通过学习单一的 Q 函数(避免了对抗训练)来模仿专家。我们在 3 个难度与所需迁移知识类型各异的环境中展示了方法的有效性。
引用
@article{arxiv.2310.06710,
title = {Zero-Shot Transfer in Imitation Learning},
author = {Alvaro Cauderan and Gauthier Boeshertz and Florian Schwarb and Calvin Zhang},
journal= {arXiv preprint arXiv:2310.06710},
year = {2023}
}