SCIZOR:面向大规模模仿学习的数据整理自监督方法
计算与语言
2025-06-03 v2 计算机视觉与模式识别
摘要
模仿学习通过使机器人从人类演示中获取多样化行为来提升其能力。然而,用于策略训练的大规模数据集通常会引入显著的质量变异性,这可能对性能产生负面影响。因此,通过过滤低质量样本来自动整理数据集以提高质量变得至关重要。现有的机器人数据整理方法依赖于昂贵的人工标注,并在粗粒度(如数据集或轨迹级别)上进行整理,未能顾及单个状态-动作对的质量。为了解决这一问题,我们引入了 SCIZOR,这是一个自监督数据整理框架,通过过滤掉低质量的状态-动作对来提升模仿学习策略的性能。SCIZOR 针对两类互补的低质量数据来源:一是带有不良动作从而阻碍学习的次优数据,二是因重复模式而稀释训练的冗余数据。SCIZOR 利用一个自监督任务进度预测器处理次优数据,以移除缺乏任务进展的样本,并利用一个作用于联合状态-动作表示的去重模块处理具有冗余模式的样本。实验表明,SCIZOR 使模仿学习策略能够以更少的数据实现更高的性能,在多个基准上平均提升了 15.4%。更多信息请访问:https://ut-austin-rpl.github.io/SCIZOR/
引用
@article{arxiv.2505.22627,
title = {Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions},
author = {Yijun Shen and Delong Chen and Fan Liu and Xingyu Wang and Chuanyi Zhang and Liang Yao and Yuhui Zheng},
journal= {arXiv preprint arXiv:2505.22627},
year = {2025}
}