TriDi:3D 人类、物体与交互的三向扩散
计算机视觉与模式识别
2025-07-29 v3
摘要
建模 3D 人体-物体交互 (HOI) 是计算机视觉中的一个极其有趣的问题,也是虚拟和混合现实应用的关键使能者。现有方法工作于单向方向:一些方法在 3D 物体条件下恢复合理的人体交互;另一些方法在人体姿态条件下恢复物体姿态。相反,我们提供了第一个统一模型 - TriDi,其可工作于任意方向。具体而言,我们同时生成 Human、Object 和 Interaction 三种模态,采用新的三向扩散过程,允许使用单个网络建模七个分布。我们将 TriDi 实现为一种注意力于各种模态标记的 transformer,从而发现它们之间的条件关系。用户可以以文本描述 HOI 或接触图形式控制交互。我们将这两种表示嵌入到共享的潜在空间中,将文本描述的实用性与接触图的表达性相结合。使用单个模型,TriDi 统一了之前工作的所有特殊情况并拓展到新的情形,构建了七个分布的模型族。令人惊讶的是,尽管使用单个模型,TriDi 在 GRAB 和 BEHAVE 上的生成样本在定性和定量指标方面均超过单向专业基线,并且表现出更好的多样性。我们展示了 TriDi 应用于场景填充、为人类接触数据集生成物体以及对未见物体几何形状的泛化。项目页面可访问于: https://virtualhumans.mpi-inf.mpg.de/tridi。
引用
@article{arxiv.2412.06334,
title = {TriDi: Trilateral Diffusion of 3D Humans, Objects, and Interactions},
author = {Ilya A. Petrov and Riccardo Marin and Julian Chibane and Gerard Pons-Moll},
journal= {arXiv preprint arXiv:2412.06334},
year = {2025}
}
备注
2025 IEEE/CVF International Conference on Computer Vision (ICCV)