用于稳定模仿的重参数化变分散度最小化
机器学习
2020-06-22 v1 机器学习
摘要
尽管近期对抗模仿学习算法的最优结果令人鼓舞,但近期探索从观测模仿学习(ILO)设定(其中轨迹仅包含专家观测)的工作尚未取得同等成功。受近期针对标准模仿学习设定中 -散度操作的调研(Ke 等,2019;Ghasemipour 等,2019)启发,我们在此考察概率散度选择的变化可在多大程度上产生性能更优的 ILO 算法。我们遗憾地发现,通过强化学习进行的 -散度最小化易受数值不稳定性影响。我们贡献了一种用于对抗模仿学习的重参数化技巧,以缓解有前景的 -散度最小化框架的优化难题。经验上,我们证明了我们的设计选择使得 ILO 算法优于基线方法,并在低维连续控制任务中更紧密地匹配专家表现。
引用
@article{arxiv.2006.10810,
title = {Reparameterized Variational Divergence Minimization for Stable Imitation},
author = {Dilip Arumugam and Debadeepta Dey and Alekh Agarwal and Asli Celikyilmaz and Elnaz Nouri and Bill Dolan},
journal= {arXiv preprint arXiv:2006.10810},
year = {2020}
}