利用自监督从不完美演示中学习以实现机器人操作
机器人学
2026-02-24 v3 人工智能
摘要
提高数据利用率,尤其是对来自任务失败的不完美数据的利用,对于机器人操作至关重要,因为现实世界中的数据收集过程充满挑战、耗时且昂贵。当前的模仿学习(IL)通常丢弃不完美数据,仅关注成功的专家数据。虽然强化学习(RL)可以从探索和失败中学习,但仿真到现实的差距及其对密集奖励和在线探索的依赖,使其难以有效地应用于现实场景。在这项工作中,我们旨在克服在不依赖奖励信息的情况下利用不完美数据以离线方式提升机器人操作模型性能的挑战。具体而言,我们引入了一种自监督数据过滤框架(SSDF),该框架结合专家数据和不完美数据来计算失败轨迹片段的质量分数。来自失败数据的高质量片段被用于扩展训练数据集。然后,增强后的数据集可与任何下游策略学习方法一起用于机器人操作任务。在基于高保真 Sapien 仿真器构建的 ManiSkill2 基准测试以及使用 Franka 机械臂的真实世界机器人操作任务上进行的大量实验表明,SSDF 能够准确地利用高质量的不完美数据扩展训练数据集,并提高所有机器人操作任务的成功率。
引用
@article{arxiv.2401.08957,
title = {Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation},
author = {Kun Wu and Ning Liu and Zhen Zhao and Di Qiu and Jinming Li and Zhengping Che and Zhiyuan Xu and Jian Tang},
journal= {arXiv preprint arXiv:2401.08957},
year = {2026}
}
备注
8 pages, 4 figures