策略对比模仿学习
机器学习
2023-07-07 v1 机器人学
摘要
对抗模仿学习(AIL)是一种流行方法,近期取得诸多成功。然而,AIL 在更具挑战性的任务上性能仍不尽如人意。我们发现主要原因之一在于 AIL 判别器表示质量较低。由于 AIL 判别器通过二分类训练,未必以有意义的方式区分策略与专家,所得奖励也可能无意义。我们提出一种称为策略对比模仿学习(PCIL)的新方法以解决此问题。PCIL 通过锚定不同策略学习对比表示空间,并生成基于平滑余弦相似度的奖励。我们提出的表示学习目标可视为 AIL 目标的更强版本,并提供智能体与策略间更有意义的比较。从理论上,我们利用学徒学习框架证明了方法的有效性。此外,我们在 DeepMind Control 套件上的实证评估表明 PCIL 可达到最优性能。最后,定性结果表明 PCIL 为模仿学习构建了更平滑且更有意义的表示空间。
引用
@article{arxiv.2307.02829,
title = {Policy Contrastive Imitation Learning},
author = {Jialei Huang and Zhaoheng Yin and Yingdong Hu and Yang Gao},
journal= {arXiv preprint arXiv:2307.02829},
year = {2023}
}