DataMIL:基于数据模型挑选机器人仿照学习的数据
机器人学
2025-05-15 v1 机器学习
摘要
最近,机器人社区积累了越来越大、越来越多样化的数据集来训练通用机器人策略。然而,尽管这些策略在各种任务上实现了强大的平均性能,但在单个特定任务上往往表现不佳,需要进一步在新获取的任务特定数据上进行调优。通过与精心挑选的大型先前数据集子集结合进行协同训练可以产生更好的特定策略,但粗略挑选数据实际上可能损害下游性能。为此,我们引入 DataMIL,一种基于数据模型范式的策略驱动数据挑选框架,用于以 end-to-end manner 推理数据挑选,使用策略本身识别哪些数据点最能提高性能。不同于基于人类质量概念(例如基于语义或视觉相似性)过滤数据的常规做法,DataMIL 直接针对任务成功进行数据挑选,允许我们选择提升策略性能的数据,同时删除降低性能的数据。在挑选过程中避免在环境中进行昂贵的 rollout,我们使用一种针对特定任务数据上的新型代理损失函数,使我们能够在不降低性能的情况下在实际中使用 DataMIL。我们在一套超过 60 个仿真和真实世界操作任务上验证了该方法——其中最突出的是成功从 Open X-Embodiment 数据集中进行数据挑选——表明在成功率和性能上均一致地实现了优势,并优于多个基线方法。我们的结果凸显了面向解锁大型先前数据集在机器人中的潜力所必需的 end-to-end、以性能为导向的数据挑选的重要性。更多信息请访问 https://robin-lab.cs.utexas.edu/datamodels4imitation/
引用
@article{arxiv.2505.09603,
title = {DataMIL: Selecting Data for Robot Imitation Learning with Datamodels},
author = {Shivin Dass and Alaa Khaddaj and Logan Engstrom and Aleksander Madry and Andrew Ilyas and Roberto Martín-Martín},
journal= {arXiv preprint arXiv:2505.09603},
year = {2025}
}