中文

在离线训练数据集中识别专家行为可改进机器人操作策略的行为克隆

机器人学 2023-09-22 v2 机器学习

摘要

本文介绍了我们针对 Real Robot Challenge(RRC)III 的解决方案,该竞赛是 NeurIPS 2022 竞赛单元中的一项,旨在通过从预收集的离线数据中学习来解决灵巧机器人操作任务。主办方为每个任务提供了两类数据集:专家数据集和具有不同技能水平的混合数据集。尽管最简单离线策略学习算法——行为克隆(BC)在专家数据集上训练时表现极为出色,其甚至优于最先进的离线强化学习(RL)算法。然而,BC 应用于混合数据集时性能下降,且离线 RL 算法表现也不尽人意。经检查混合数据集,我们观察到其中包含大量未标注的专家数据。为解决此问题,我们提出了一种基于半监督学习的分类器来识别混合数据集中潜在的专家行为,有效隔离出专家数据。为进一步提升 BC 性能,我们利用 RRC 场地的几何对称性,通过数学变换扩充训练数据集。最终,我们的提交结果超越了所有其他参与者,包括那些采用复杂离线 RL 算法及精细数据处理与特征工程技术的队伍。

关键词

引用

@article{arxiv.2301.13019,
  title  = {Identifying Expert Behavior in Offline Training Datasets Improves Behavioral Cloning of Robotic Manipulation Policies},
  author = {Qiang Wang and Robert McCarthy and David Cordova Bulens and Francisco Roldan Sanchez and Kevin McGuinness and Noel E. O'Connor and Stephen J. Redmond},
  journal= {arXiv preprint arXiv:2301.13019},
  year   = {2023}
}