解耦层次变分自编码器用于 3D 人体-人体交互生成
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
生成逼真的 3D 人体-人体交互 (HHI) 需要对行动代理及其交互语义进行连贯的物理可行性建模。现有方法将所有运动信息压缩到单个潜在表示中,限制了其捕捉细粒度动作和代理间相互作用的能力。这会导致语义错位和物理上不合理的痕迹,如穿透或错位接触。我们提出一种基于解耦层次变分自编码器 (DHVAE) 的潜在扩散方法,用于结构化和可控的 HHI 生成。DHVAE 通过采用 CoTransformer 模块,将全局交互上下文和 individual 运动模式解耦到解耦的潜在结构中。为缓解 HHI 中不合理且物理不一致的接触,我们将对比学习约束纳入 DHVAE,以促进更具辨识度和物理可行性的潜在交互空间。为实现高保真交互合成,DHVAE 在层次化潜在空间中采用基于 DDIM 的扩散去噪过程,并通过带跳跃连接的 AdaLN-Transformer 去噪器加以增强。广泛的评估表明,DHVAE 在运动保真度、文本对齐和物理可行性方面均优于现有方法,同时具有更大的计算效率。
引用
@article{arxiv.2603.00144,
title = {Disentangled Hierarchical VAE for 3D Human-Human Interaction Generation},
author = {Zichen Geng and Zeeshan Hayder and Bo Miao and Jian Liu and Wei Liu and Ajmal Mian},
journal= {arXiv preprint arXiv:2603.00144},
year = {2026}
}