中文

基于置信度感知的变最优性演示模仿学习

机器学习 2022-01-27 v2 人工智能 机器人学

摘要

大多数现有模仿学习方法假设演示数据来自最优的专家,但放宽这一假设使我们能够使用更广泛的数据。标准模仿学习可能从具有不同最优性的演示中学习到次优策略。先前的工作使用置信度分数或排序来从具有不同最优性的演示中捕获有益信息,但它们存在诸多局限,例如需要人工标注的置信度分数或演示的平均最优性较高。在本文中,我们提出了一个从具有不同最优性的演示中学习的通用框架,该框架联合学习置信度分数和表现良好的策略。我们的方法,置信度感知模仿学习(CAIL),从置信度重加权后的演示中学习表现良好的策略,同时使用外层损失来跟踪模型性能并学习置信度。我们提供了 CAIL 收敛性的理论保证,并在仿真和真实机器人实验中评估了其性能。我们的结果表明,CAIL 显著优于其他基于不同最优性演示的模仿学习方法。我们进一步表明,即使无法获得任何最优演示,CAIL 仍能学习到成功的策略,并且优于先前的工作。

关键词

引用

@article{arxiv.2110.14754,
  title  = {Confidence-Aware Imitation Learning from Demonstrations with Varying Optimality},
  author = {Songyuan Zhang and Zhangjie Cao and Dorsa Sadigh and Yanan Sui},
  journal= {arXiv preprint arXiv:2110.14754},
  year   = {2022}
}

备注

18 pages, 4 figures, 3 tables. Published at Conference on Neural Information Processing Systems (NeurIPS) 2021