利用正未标记学习改进行为克隆
机器学习
2023-09-22 v2 机器人学
摘要
从预记录数据集中离线学习控制策略,是解决具有挑战性的现实世界问题的一条有前景的途径。然而,可用数据集通常质量参差不齐,其中被视为正例(即高质量演示)的轨迹数量有限。因此,我们提出了一种新颖的迭代学习算法,用于在给定最少正例的情况下,从质量混杂的未标记机器人数据集中识别专家轨迹,其在准确性上超越现有算法。我们表明,对所得过滤后的数据集应用行为克隆,优于多个有竞争力的离线强化学习和模仿学习基线。我们在一系列模拟运动任务以及真实机器人系统上的两个具有挑战性的操纵任务上进行了实验;在这些实验中,我们的方法展示了最先进的性能。我们的网站:\url{https://sites.google.com/view/offline-policy-learning-pubc}。
引用
@article{arxiv.2301.11734,
title = {Improving Behavioural Cloning with Positive Unlabeled Learning},
author = {Qiang Wang and Robert McCarthy and David Cordova Bulens and Kevin McGuinness and Noel E. O'Connor and Nico Gürtler and Felix Widmaier and Francisco Roldan Sanchez and Stephen J. Redmond},
journal= {arXiv preprint arXiv:2301.11734},
year = {2023}
}