EgoDex:来自大规模环视视频的灵巧操控学习
计算机视觉与模式识别
2026-03-10 v3 机器学习
机器人学
摘要
操控仿真学习面临数据稀缺问题。与自然语言和 2D 计算机视觉不同,没有面向灵巧操控的互联网规模数据语料库。一个有吸引力的选项是环视人类视频,一种被动可扩展的数据源。然而,现有的大规模数据集(如 Ego4D)没有本地手部姿态标注,也不专注于对象操控。为此,我们使用 Apple Vision Pro 收集 EgoDex:截至目前最大且最具多样性的灵巧人类操控数据集。EgoDex 包含 829 小时的环视视频,配有在录制时收集的成对 3D 手部和手指跟踪数据,其中可以使用多个已校准摄像头和设备内 SLAM 来精确跟踪每只手每个关节的姿态。该数据集涵盖了多种多样化的操控行为,使用 194 种不同的桌面任务中的日常家庭用品,从系鞋带到折叠衣物。此外,我们在该数据集上训练和系统评估仿射学习策略,用于手轨迹预测,引入度量和基准,用于衡量这一越来越重要领域的进展。通过发布这个大规模数据集,我们希望推动机器人、计算机视觉和基础模型的前沿。EgoDex 已在 https://github.com/apple/ml-egodex 上公开获取。
引用
@article{arxiv.2505.11709,
title = {EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video},
author = {Ryan Hoque and Peide Huang and David J. Yoon and Mouli Sivapurapu and Jian Zhang},
journal= {arXiv preprint arXiv:2505.11709},
year = {2026}
}
备注
ICLR 2026