IQ-Learn:用于模仿的逆软 Q 学习
机器学习
2022-11-04 v4 人工智能
摘要
在许多序列决策问题中(例如机器人控制、博弈对弈、序列预测),可用包含任务有用信息的人类或专家数据。然而,从少量专家数据进行模仿学习(IL)在高维环境与复杂动态下可能具有挑战性。行为克隆是一种简单方法,因其实现简单与收敛稳定而被广泛使用,但不利用任何涉及环境动态的信息。许多利用动态信息的现有方法由于对奖励与策略近似器的对抗优化过程或偏差大、高方差梯度估计器而在实践中难以训练。我们引入一种动态感知的 IL 方法,通过学习单个 Q 函数(隐式表示奖励与策略)来避免对抗训练。在标准基准上,隐式学习的奖励与真实奖励呈现高度正相关,说明我们的方法也可用于逆强化学习(IRL)。我们的方法,逆软 Q 学习(IQ-Learn)在离线与在线模仿学习设定中取得最先进结果,在所需环境交互次数与高维空间可扩展性上显著优于现有方法,常超出 3 倍以上。
引用
@article{arxiv.2106.12142,
title = {IQ-Learn: Inverse soft-Q Learning for Imitation},
author = {Divyansh Garg and Shuvam Chakraborty and Chris Cundy and Jiaming Song and Matthieu Geist and Stefano Ermon},
journal= {arXiv preprint arXiv:2106.12142},
year = {2022}
}
备注
Spotlight in NeurIPS 2021. Winner of '21 MineRL BASALT Challenge. Website: https://div99.github.io/IQ-Learn