中文

InterMask:基于协作遮盖建模的3D人类互动生成

计算机视觉与模式识别 2025-03-04 v3

摘要

从文本描述生成逼真的3D人类-人类互动仍是具有挑战性的任务。现有方法通常基于扩散模型,生成结果缺乏逼真度和保真度。本文引入InterMask,一种利用离散空间协作遮盖建模生成人类互动的新型框架。InterMask首先采用VQ-VAE将每个运动序列转换为2D离散运动token图。不同于传统的1D VQ token图,它更好地保留了细粒度时空细节,促进每个token内部的空间感知。基于此表示,InterMask利用生成式遮盖建模框架协作建模两个相互作用个体的token。通过专为捕捉复杂时空相互依赖性设计的Transformer架构实现。训练期间,随机遮盖两个个体的运动token并学习其预测。推理时,从完全遮盖的序列开始,逐步填充两个个体的token。凭借增强的运动表示、专用架构和有效的学习策略,InterMask实现了最先进的成果,生成高保真度和多样性的人类互动。在InterHuman数据集上实现了FID为5.1545.154(相较于in2IN的5.5355.535),在InterX数据集上实现了0.3990.399(相较于InterGen的5.2075.207)。此外,InterMask无需模型 redesign 或微调即可无缝支持反应生成。

关键词

引用

@article{arxiv.2410.10010,
  title  = {InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling},
  author = {Muhammad Gohar Javed and Chuan Guo and Li Cheng and Xingyu Li},
  journal= {arXiv preprint arXiv:2410.10010},
  year   = {2025}
}

备注

Project webpage: https://gohar-malik.github.io/intermask