HumanNet:将以人为中心的视频学习扩展至一百万小时
计算机视觉与模式识别
2026-05-11 v1 机器人学
摘要
具身智能的进步越来越依赖于可扩展的数据基础设施。虽然视觉和语言已随着互联网语料库而扩展,但学习物理交互仍因缺乏大规模、多样化且标注丰富的人类活动数据而受到限制。我们提出了 HumanNet,一个一百万小时以人为中心的视频语料库,大规模捕捉了人类如何与物理世界交互。HumanNet 涵盖第一人称和第三人称视角,覆盖了不同真实世界环境中的细粒度活动、人-物交互、工具使用和长时程行为。除了原始视频外,该数据集还提供了以交互为中心的标注,包括字幕、运动描述以及手部和身体相关信号,从而实现运动感知和交互感知学习。除了规模之外,HumanNet 还引入了用于具身学习的系统化数据整理范式,其中以人为中心的过滤、时间结构化、视角多样性和标注丰富性被视为首要设计原则。这种设计将非结构化的互联网视频转化为用于表示学习、活动理解、运动生成和人-机迁移的可扩展基底。我们通过受控的视觉-语言-动作消融实验对该设计的价值进行了初步验证:在一组固定的验证数据下,使用从 HumanNet 中提取的 1000 小时第一人称视频对 Qwen VLM 模型进行持续训练,其效果优于使用来自 Magic Cobot 的 100 小时真实机器人数据进行持续训练,这表明第一人称人类视频可以成为机器人数据的可扩展且具成本效益的替代品。通过构建此项目,我们旨在探索利用以人为中心的视频来扩展具身基础模型的机会,而不是仅仅依赖特定于机器人的数据。
引用
@article{arxiv.2605.06747,
title = {HumanNet: Scaling Human-centric Video Learning to One Million Hours},
author = {Yufan Deng and Daquan Zhou},
journal= {arXiv preprint arXiv:2605.06747},
year = {2026}
}
备注
Github: https://github.com/DAGroup-PKU/HumanNet Project website: https://dagroup-pku.github.io/HumanNet/