中文

InterFusion:文本驱动的3D人-物交互生成

计算机视觉与模式识别 2024-07-17 v2

摘要

在本研究中,我们以零样本文本到3D的方式处理从文本描述生成3D人-物交互(HOI)这一复杂任务。我们识别并解决两个关键挑战:直接文本到3D方法在HOI中效果不佳,主要是由于缺乏配对的文本-交互数据;以及同时生成具有复杂空间关系的多个概念的内在困难。为有效解决这些问题,我们提出了InterFusion,一个专门为HOI生成设计的两阶段框架。InterFusion将从文本中提取的人体姿态估计作为几何先验,简化了文本到3D的转换过程,并为精确的对象生成引入了额外约束。在第一阶段,InterFusion从合成图像数据集中提取3D人体姿态,该数据集描绘了广泛的交互,随后将这些姿态映射到交互描述。第二阶段利用文本到3D生成的最新进展,能够生成逼真且高质量的3D HOI场景。这是通过局部-全局优化过程实现的,其中人体和对象的生成分别优化,并通过整个场景的全局优化联合细化,确保无缝且上下文连贯的集成。我们的实验结果证实,InterFusion在3D HOI生成方面显著优于现有最先进方法。

关键词

引用

@article{arxiv.2403.15612,
  title  = {InterFusion: Text-Driven Generation of 3D Human-Object Interaction},
  author = {Sisi Dai and Wenhao Li and Haowen Sun and Haibin Huang and Chongyang Ma and Hui Huang and Kai Xu and Ruizhen Hu},
  journal= {arXiv preprint arXiv:2403.15612},
  year   = {2024}
}

备注

ECCV 2024; Project page https://sisidai.github.io/InterFusion/; Code available at https://github.com/sisidai/InterFusion