学习操控任意物体:揭示边界框引导策略中的数据缩放定律
机器人学
2026-02-13 v1
摘要
基于扩散的策略在语义操控中表现出有限的泛化能力,这构成了现实世界机器人部署的关键障碍。这种局限性源于仅依赖文本指令不足以在复杂和动态环境中引导策略关注目标物体。为解决此问题,我们提出利用边界框指令直接指定目标物体,并进一步研究语义操控任务中是否存在数据缩放定律。具体来说,我们设计了一个手持式分割设备,配备自动化标注流水线Label-UMI,能够高效收集带有语义标签的演示数据。我们进一步提出了一个语义-运动解耦框架,该框架集成了目标检测和边界框引导的扩散策略,以提高语义操控中的泛化能力和适应性。通过在大型数据集上进行广泛的真实世界实验,我们验证了该方法的有效性,并揭示了泛化性能与边界框物体数量之间的幂律关系。最后,我们总结了一种有效的语义操控数据收集策略,该策略在四个任务上,对已见和未见物体均能达到85%的成功率。所有数据集和代码将向社区发布。
引用
@article{arxiv.2602.11885,
title = {Learning to Manipulate Anything: Revealing Data Scaling Laws in Bounding-Box Guided Policies},
author = {Yihao Wu and Jinming Ma and Junbo Tan and Yanzhao Yu and Shoujie Li and Mingliang Zhou and Diyun Xiang and Xueqian Wang},
journal= {arXiv preprint arXiv:2602.11885},
year = {2026}
}