中文

GRIP:利用空间线索与潜空间一致性生成交互姿态

计算机视觉与模式识别 2024-07-16 v2

摘要

手是灵巧且高度通用的操纵器,是人类与物体及环境交互的核心。因此,建模真实的手-物体交互,包括单个手指的细微运动,对计算机图形学、计算机视觉与混合现实应用至关重要。先前关于在3D中捕捉和建模人与物体交互的工作聚焦于身体与物体运动,常忽略手部姿态。相反,我们提出GRIP,一种基于学习的方法,以身体与物体的3D运动作为输入,并合成物体交互前、中、后的双手真实运动。在合成手部运动前的预备步骤中,我们首先使用一个网络ANet对身体运动去噪。然后,我们利用身体与物体之间的时空关系提取两类新颖的时间交互线索,并在两阶段推理流水线中使用它们生成手部运动。在第一阶段,我们引入一种在潜空间(LTC)中强制运动时间一致性的新方法,并生成一致的交互运动。在第二阶段,GRIP生成精细化的手部姿态以避免手-物体穿透。给定含噪声的身体与物体运动序列,GRIP将其升级以包含手-物体交互。定量实验与感知研究表明,GRIP优于基线方法,并能泛化至来自不同动作捕捉数据集的未见物体与运动。

关键词

引用

@article{arxiv.2308.11617,
  title  = {GRIP: Generating Interaction Poses Using Spatial Cues and Latent Consistency},
  author = {Omid Taheri and Yi Zhou and Dimitrios Tzionas and Yang Zhou and Duygu Ceylan and Soren Pirk and Michael J. Black},
  journal= {arXiv preprint arXiv:2308.11617},
  year   = {2024}
}

备注

The project has been started during Omid Taheri's internship at Adobe and as a collaboration with the Max Planck Institute for Intelligent Systems