中文

ManiVideo:基于灵巧且可泛化抓取的手物交互视频生成

计算机视觉与模式识别 2024-12-24 v1

摘要

本文介绍了ManiVideo,一种从给定的手和物体的运动序列中生成一致且时间连贯的双手物体操作视频的新方法。其核心思想是构建一种多层遮挡(MLO)表示,该表示从无遮挡法线图和遮挡置信度图中学习3D遮挡关系。通过将MLO结构以两种形式嵌入UNet,该模型增强了灵巧手物操作的3D一致性。为了进一步实现物体的可泛化抓取,我们整合了大规模3D物体数据集Objaverse,以解决视频数据稀缺的问题,从而促进对广泛物体一致性的学习。此外,我们提出了一种创新的训练策略,能够有效整合多个数据集,支持以人为中心的手物交互视频生成等下游任务。通过大量实验,我们证明了我们的方法不仅能生成具有合理手物交互和可泛化物体的视频,而且性能优于现有的最先进方法。

关键词

引用

@article{arxiv.2412.16212,
  title  = {ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping},
  author = {Youxin Pang and Ruizhi Shao and Jiajun Zhang and Hanzhang Tu and Yun Liu and Boyao Zhou and Hongwen Zhang and Yebin Liu},
  journal= {arXiv preprint arXiv:2412.16212},
  year   = {2024}
}