中文

DiffH2O: 基于扩散的从文本描述生成手-物体交互

计算机视觉与模式识别 2024-12-24 v2 人工智能 图形学 机器学习

摘要

生成符合物理约束且语义意义明确的 3D 手-物体交互具有挑战性。此外,由于手-物体交互数据集规模有限,通往未见物体的泛化能力也受到限制。本文提出一种新方法,称为 DiffH2O,可从提供的文本提示和物体几何形状合成真实的单手或双手物体交互。该方法引入了三项技术,使其能够从有限数据中有效学习。首先,将任务分解为抓取阶段和基于文本的操纵阶段,并为每个阶段使用独立的扩散模型。在抓取阶段,模型仅生成手的运动;而在操纵阶段,同时合成手和物体的姿态。其次,我们提出一种紧凑表示方法,将手和物体姿态紧密耦合,有助于生成真实的手-物体交互。最后,我们提出两种不同的引导方案,以实现对生成运动的更好控制:抓取引导和详细文本引导。抓取引导采用单个目标抓取姿态,引导扩散模型在抓取阶段结束时到达该抓取姿态,从而提供对抓取姿态的控制。给定该阶段的抓取运动后,可在操纵阶段提示多个不同的动作。对于文本引导,我们为 GRAB 数据集贡献了详尽的文本描述,并表明这些描述使我们的方法能够对手-物体交互实现更细致的控制。我们的定量和定性评估表明,所提方法优于基线方法,生成自然的手-物体运动。

关键词

引用

@article{arxiv.2403.17827,
  title  = {DiffH2O: Diffusion-Based Synthesis of Hand-Object Interactions from Textual Descriptions},
  author = {Sammy Christen and Shreyas Hampali and Fadime Sener and Edoardo Remelli and Tomas Hodan and Eric Sauser and Shugao Ma and Bugra Tekin},
  journal= {arXiv preprint arXiv:2403.17827},
  year   = {2024}
}

备注

Project Page: https://diffh2o.github.io/