样本高效的对抗模仿学习
机器学习
2024-01-24 v2 人工智能
摘要
模仿学习通过示范进行学习,已在奖励函数未预定义的序贯决策任务中得到研究与推进。然而,模仿学习方法仍需大量专家示范样本才能成功模仿专家行为。为提升样本效率,我们利用自监督表示学习,其能从给定数据生成大量训练信号。在本研究中,我们提出一种基于自监督表示的对抗模仿学习方法,用于在非图像控制任务上学习对多种失真具有鲁棒性且具时间预测性的状态与动作表示。特别地,相较于现有的表格数据自监督学习方法,我们提出了一种不同的状态与动作表示损坏方法,其对多种失真具有鲁棒性。我们从理论与经验上观察到,以更低样本复杂度构建信息丰富的特征流形可显著提升模仿学习性能。所提方法在仅限 100 个专家状态-动作对的 MuJoCo 设定下,相对现有对抗模仿学习方法取得 39% 的提升。此外,我们利用具有不同最优性的示范进行了全面的消融与额外实验,以洞察一系列影响因素。
引用
@article{arxiv.2303.07846,
title = {Sample-efficient Adversarial Imitation Learning},
author = {Dahuin Jung and Hyungyu Lee and Sungroh Yoon},
journal= {arXiv preprint arXiv:2303.07846},
year = {2024}
}
备注
Published at JMLR (Journal of Machine Learning Research), A preliminary version of this manuscript was presented at Deep RL Workshop, NeurIPS 2022