中文

DexImit:基于单目人类视频学习双手灵巧操控

机器人学 2026-02-11 v1

摘要

数据稀缺在根本上限制了双手灵巧操控的泛化能力,因为为灵巧手收集真实数据成本高昂且费力。人类操控视频作为操控知识的直接载体,具有显著的规模化潜力。然而,人类手和机器人灵巧手之间的显著本体差距,使得直接从人类视频进行预训练极其具有挑战性。为弥合这一差距并发挥大规模人类操控视频数据的潜力,我们提出 DexImit,一个自动化框架,可将单目人类操控视频转换为无需额外信息的物理上合理的机器人数据。DexImit 采用四阶段生成流程:(1)从任意视角重建手部-物体交互并实现近似尺度;(2)执行子任务分解和双手调度;(3)合成与演示交互一致的机器人轨迹;(4)为零样本真实部署进行全面数据增强。基于这些设计,DexImit 可基于人类视频(来自互联网或视频生成模型)生成大规模机器人数据。DexImit 能够处理多样化的操控任务,包括工具使用(如切割苹果)、长期任务(如调配饮料)以及细粒度操控(如叠叠盘)。

关键词

引用

@article{arxiv.2602.10105,
  title  = {DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos},
  author = {Juncheng Mu and Sizhe Yang and Yiming Bao and Hojin Bae and Tianming Wei and Linning Xu and Boyi Li and Huazhe Xu and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2602.10105},
  year   = {2026}
}