用于模仿学习的 SoftDICE:重新思考离屏策略分布匹配
机器学习
2021-06-08 v1 人工智能
摘要
我们提出 SoftDICE,其在模仿学习中达到了最先进性能。SoftDICE 修复了 ValueDICE 中的若干关键问题,ValueDICE 是一种用于样本高效模仿学习的离屏策略分布匹配方法。具体而言,ValueDICE 的目标包含期望的对数和指数,其小批量梯度估计始终有偏。其次,当专家示范数量有限时,ValueDICE 用回放缓冲样本正则化目标,但这改变了原始分布匹配问题。第三,用于推导离屏策略目标的重参数化技巧依赖于一个在训练中很少成立的隐含假设。我们利用一种新颖的分布匹配公式并考虑熵正则化离屏策略目标,从而得到一种称为 SoftDICE 的完全离线算法。我们的经验结果表明,SoftDICE 仅用一条示范轨迹且无需进一步同策略/离屏策略样本即可恢复专家策略。SoftDICE 在 Mujoco 基准任务上也以样本效率稳定优于 ValueDICE 及其他基线。
引用
@article{arxiv.2106.03155,
title = {SoftDICE for Imitation Learning: Rethinking Off-policy Distribution Matching},
author = {Mingfei Sun and Anuj Mahajan and Katja Hofmann and Shimon Whiteson},
journal= {arXiv preprint arXiv:2106.03155},
year = {2021}
}