中文

对抗模仿学习中的无标签不完美示范

机器学习 2023-02-14 v1 人工智能

摘要

对抗模仿学习已成为一种广泛使用的模仿学习框架。判别器通常将专家示范与策略轨迹分别作为两类(正类与负类)样本进行训练,进而期望策略生成与专家示范无法区分的轨迹。但在现实世界中,收集到的专家示范更可能是不完美的,其中仅有未知比例的示范是最优的。我们并非将不完美专家示范绝对地视为正类或负类,而是按原样研究无标签的不完美专家示范。我们提出了一种正-无标签对抗模仿学习算法,用于动态采样能够与持续优化的智能体策略轨迹良好匹配的专家示范。初始智能体策略的轨迹可能更接近那些非最优专家示范,但在对抗模仿学习框架下,智能体策略将被优化以欺骗判别器并生成类似于最优专家示范的轨迹。理论分析表明,我们的方法以一种自步进的方式从不完美示范中学习。在 MuJoCo 与 RoboSuite 平台上的实验结果从不同方面证明了我们方法的有效性。

关键词

引用

@article{arxiv.2302.06271,
  title  = {Unlabeled Imperfect Demonstrations in Adversarial Imitation Learning},
  author = {Yunke Wang and Bo Du and Chang Xu},
  journal= {arXiv preprint arXiv:2302.06271},
  year   = {2023}
}

备注

AAAI 2023