In-N-On:规模化的体姿操控学习中的 Egocentric 数据的 In-the-wild 与 On-task 结合
机器人学
2025-11-20 v1 人工智能
计算机视觉与模式识别
摘要
体姿视频是学习操控策略的宝贵且可扩展的数据来源。然而,由于数据异构性显著,大多数现有方法仅利用人类数据进行简单预训练,无法发挥其全部潜能。本文首先提供一种可扩展的数据收集与使用的配方,通过将人类数据分为“野外(in-the-wild)”和“任务(on-task)”两类,并对如何使用数据进行系统性分析。我们首先策划了一个数据集 PHSD,其中包含超过 1000 小时的多样化野外体姿数据,以及约 20 小时的任务数据,直接对齐目标操控任务。这使得我们能够学习一个大规模的语言条件化流匹配策略 Human0。通过域适应技术,Human0 最小化了人类与类人机器人之间的差距。经验上,我们展示 Human0 从规模化的人类数据中实现了若干新特性,包括仅凭人类数据即可遵循指令的语言跟随、few-shot 学习,以及利用任务数据提高的鲁棒性。项目网站:https://xiongyicai.github.io/In-N-On/
关键词
引用
@article{arxiv.2511.15704,
title = {In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data},
author = {Xiongyi Cai and Ri-Zhao Qiu and Geng Chen and Lai Wei and Isabella Liu and Tianshu Huang and Xuxin Cheng and Xiaolong Wang},
journal= {arXiv preprint arXiv:2511.15704},
year = {2025}
}
备注
Project webpage: https://xiongyicai.github.io/In-N-On/