支持度加权的对抗模仿学习
机器学习
2020-02-21 v1 机器学习
摘要
对抗模仿学习(AIL)是一类广泛的模仿学习方法,旨在从演示中模仿专家行为。尽管 AIL 在仅使用少量演示的模仿学习上展现了最先进的性能,但它面临若干实际挑战,例如潜在的训练不稳定性和隐式奖励偏差。为应对这些挑战,我们提出了支持度加权的对抗模仿学习(SAIL),这是一个通用框架,利用从专家策略的支持度估计中导出的信息来扩展给定的 AIL 算法。SAIL 通过用专家策略支持度估计得到的置信度分数对对抗奖励进行加权,从而提升强化信号的质量。我们还证明,SAIL 的效率始终至少与其用于学习对抗奖励的底层 AIL 算法相当。在经验上,我们表明所提方法在一系列基准控制任务上比基线方法取得了更好的性能和训练稳定性。
引用
@article{arxiv.2002.08803,
title = {Support-weighted Adversarial Imitation Learning},
author = {Ruohan Wang and Carlo Ciliberto and Pierluigi Amadori and Yiannis Demiris},
journal= {arXiv preprint arXiv:2002.08803},
year = {2020}
}