中文

GenZI:零样本三维人与场景交互生成

计算机视觉与模式识别 2023-11-30 v1 图形学

摘要

我们能否在不从任何三维人与场景交互数据中学习的情况下,合成与场景交互的三维人体?我们提出 GenZI,首个生成三维人与场景交互的零样本方法。GenZI 的关键在于从大型视觉-语言模型(VLM)中提炼交互先验,这些模型已习得丰富的二维人与场景组合的语义空间。给定自然语言描述以及三维场景中期望交互的粗略点位置,我们首先利用 VLM 将合理的二维人体交互想象并补全到场景的多个渲染视图中。随后,我们构建一种鲁棒的迭代优化,以二维交互假设的一致性为引导,合成场景中三维人体模型的姿态与形状。与现有的基于学习的方法不同,GenZI 规避了对采集的三维交互数据的常规需求,并可通过易用的文本提示灵活控制三维交互合成。大量实验表明,我们的零样本方法具有高灵活性与通用性,可适用于包括室内与室外环境在内的多样场景类型。

关键词

引用

@article{arxiv.2311.17737,
  title  = {GenZI: Zero-Shot 3D Human-Scene Interaction Generation},
  author = {Lei Li and Angela Dai},
  journal= {arXiv preprint arXiv:2311.17737},
  year   = {2023}
}

备注

Project page: https://craigleili.github.io/projects/genzi/ Video: https://youtu.be/ozfs6E0JIMY