中文

Text2HOI:文本引导的手物交互 3D 动作生成

计算机视觉与模式识别 2024-04-03 v2

摘要

本文介绍了首个用于生成 3D 手物交互序列的文本引导工作。主要挑战源于缺乏标注数据,现有的真值数据集在交互类型和物体类别上远不具备泛化能力,这阻碍了从文本提示中建模具有正确物理含义(例如接触和语义)的多样化 3D 手物交互。为了应对这一挑战,我们提出将交互生成任务分解为两个子任务:手物接触生成和手物动作生成。对于接触生成,一个基于 VAE 的网络以文本和物体网格为输入,生成交互过程中手表面与物体表面之间接触的概率。该网络学习了与物体类别无关的多种物体的局部几何结构,因此适用于一般物体。对于动作生成,一个基于 Transformer 的扩散模型利用这种 3D 接触图作为强先验,通过从增强的标注数据集中学习,生成作为文本提示函数的物理上合理的手物动作;其中我们从许多现有的 3D 手和物体运动数据中标注了文本标签。最后,我们进一步引入了一个手部细化模块,该模块最小化物体表面与手部关节之间的距离,以提高手物接触的时序稳定性并抑制穿透伪影。在实验中,我们证明了与其他基线方法相比,我们的方法可以生成更逼真和更多样化的交互。我们还表明我们的方法适用于未见过的物体。我们将发布我们的模型和新标注的数据,作为未来研究的坚实基础。代码和数据可在:https://github.com/JunukCha/Text2HOI 获取。

关键词

引用

@article{arxiv.2404.00562,
  title  = {Text2HOI: Text-guided 3D Motion Generation for Hand-Object Interaction},
  author = {Junuk Cha and Jihyeon Kim and Jae Shin Yoon and Seungryul Baek},
  journal= {arXiv preprint arXiv:2404.00562},
  year   = {2024}
}

备注

Accepted to CVPR 2024