中文

多模态先验增强的文本驱动3D人体-物体相互作用生成

计算机视觉与模式识别 2026-02-12 v1

摘要

我们解决了文本驱动3D人体-物体相互作用 (HOI) 运动生成的挑战性问题。现有方法主要依赖直接的文本到 HOI 映射,由于跨模态差距导致三个关键局限性: (Q1) 人体运动次优 (Q2) 物体运动不自然 (Q3) 人体与物体之间的相互作用较弱。为解决这些挑战,我们提出了 MP-HOI 框架,基于四个核心见解: (1) 多模态数据先验: 我们利用来自大型多模态模型的文本、图像、姿态/物体数据作为先验,以指导 HOI 生成,从而解决 Q1 和 Q2 的数据建模问题。 (2) 增强的对象表示: 我们通过融合几何关键点、接触特征和动态属性来改进现有对象表示,实现表达性更强的对象表示,解决 Q2 的数据表示问题。 (3) 多模态感知混合专家 (MoE) 模型: 我们提出一种模态感知 MoE 模型,用于有效的多模态特征融合范式,解决 Q1 和 Q2 的特征融合问题。 (4) 带相互作用监督的级联扩散: 我们设计一种级联扩散框架,对人体-物体相互作用特征在专门的监督下进行逐步细化,解决 Q3 的相互作用细化问题。全面实验表明,MP-HOI 在生成高保真和细粒度 HOI 运动方面优于现有方法。

关键词

引用

@article{arxiv.2602.10659,
  title  = {Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation},
  author = {Yin Wang and Ziyao Zhang and Zhiying Leng and Haitian Liu and Frederick W. B. Li and Mu Li and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2602.10659},
  year   = {2026}
}