中文

SCIZOR:面向大规模模仿学习的数据 curated 的自监督方法

机器人学 2025-09-10 v2 人工智能 机器学习

摘要

模仿学习通过从人类演示中获取多样化行为来提升机器人的能力。然而,用于策略训练的大规模数据集常常引入显著的质量变异性,这会对性能产生负面影响。因此,自动化地通过过滤低质量样本来提升数据质量变得至关重要。现有的机器人数据 curated 方法依赖于高成本的手动标注,并以数据集或轨迹级别进行粗粒度的 curated,未能考虑到单个状态-动作对的质量。为此,我们引入 SCIZOR,一种自监督数据 curated 框架,用于过滤低质量的状态-动作对,以提高模仿学习策略的性能。SCIZOR 针对两种互补的低质量数据来源进行针对性处理:次优数据会阻碍学习不理想的动作,冗余数据则通过重复模式稀释训练。SCIZOR 利用自监督任务进度预测器处理次优数据,以移除缺乏任务进展的样本;同时,基于联合状态-动作表示的去重模块处理冗余模式。实验表明,SCIZOR 使模仿学习策略能够以更少的数据获得更高的性能,平均提升 15.4%。更多信息请访问:https://ut-austin-rpl.github.io/SCIZOR/

关键词

引用

@article{arxiv.2505.22626,
  title  = {SCIZOR: A Self-Supervised Approach to Data Curation for Large-Scale Imitation Learning},
  author = {Yu Zhang and Yuqi Xie and Huihan Liu and Rutav Shah and Michael Wan and Linxi Fan and Yuke Zhu},
  journal= {arXiv preprint arXiv:2505.22626},
  year   = {2025}
}