中文

通过对抗式置信度迁移从非完美演示中学习

机器人学 2022-03-03 v2 机器学习

摘要

现有的示范学习算法通常假设可以获取专家演示。然而,这一假设在许多现实应用中具有局限性,因为收集到的演示可能是次优的,甚至包含失败案例。因此,我们研究通过学习的置信度预测器从非完美演示中学习的问题。具体而言,我们利用来自不同对应环境(源环境)的演示及其置信度值,来学习目标环境(我们旨在学习策略的环境——在该环境中我们仅有未标注的演示)的置信度预测器。我们通过多长度部分轨迹的对抗式分布匹配学习一个公共潜在空间,以实现置信度在源环境与目标环境之间的迁移。学习到的置信度对演示进行重新加权,从而更多地从信息丰富的演示中学习并丢弃无关演示。我们在三个仿真环境和一个真实机器人抓取任务中的实验表明,我们的方法学习到的策略具有最高的期望回报。

关键词

引用

@article{arxiv.2202.02967,
  title  = {Learning from Imperfect Demonstrations via Adversarial Confidence Transfer},
  author = {Zhangjie Cao and Zihan Wang and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2202.02967},
  year   = {2022}
}