中文

InterDreamer:零样本文本到 3D 动态人物-物体交互

计算机视觉与模式识别 2026-02-03 v2 人工智能

摘要

以文本为条件的人体运动生成在基于大量动作捕捉数据和相应文本注释训练的扩散模型方面取得了显著进展。然而,将这种成功扩展到 3D 动态人物-物体交互(HOI)生成面临着显著的挑战,这主要是由于缺乏大规模交互数据以及与这些交互对齐的全面描述。本文采取主动,展示了在未直接对文本-交互对数据进行训练的情况下生成人物-物体交互的潜力。我们实现这一点的关键见解是交互语义和动力学可以解耦。由于无法通过监督训练来学习交互语义,我们转而利用预训练的大模型,协同来自大语言模型和文本到运动模型的知识。虽然这些知识提供了对交互语义的高层控制,但它无法掌握低层交互动力学的复杂性。为了克服这个问题,我们进一步引入了一个旨在理解简单物理的世界模型,对人类动作如何影响物体运动进行建模。通过整合这些组件,我们的新框架 InterDreamer 能够以零样本方式生成文本对齐的 3D HOI 序列。我们将 InterDreamer 应用于 BEHAVE 和 CHAIRS 数据集,我们全面的实验分析证明了其生成与文本指令无缝对齐的逼真且连贯的交互序列的能力。

关键词

引用

@article{arxiv.2403.19652,
  title  = {InterDreamer: Zero-Shot Text to 3D Dynamic Human-Object Interaction},
  author = {Sirui Xu and Ziyin Wang and Yu-Xiong Wang and Liang-Yan Gui},
  journal= {arXiv preprint arXiv:2403.19652},
  year   = {2026}
}

备注

NeurIPS 2024. Project Page: https://sirui-xu.github.io/InterDreamer/