InterMask:基于协作遮盖建模的3D人类互动生成
计算机视觉与模式识别
2025-03-04 v3
摘要
从文本描述生成逼真的3D人类-人类互动仍是具有挑战性的任务。现有方法通常基于扩散模型,生成结果缺乏逼真度和保真度。本文引入InterMask,一种利用离散空间协作遮盖建模生成人类互动的新型框架。InterMask首先采用VQ-VAE将每个运动序列转换为2D离散运动token图。不同于传统的1D VQ token图,它更好地保留了细粒度时空细节,促进每个token内部的空间感知。基于此表示,InterMask利用生成式遮盖建模框架协作建模两个相互作用个体的token。通过专为捕捉复杂时空相互依赖性设计的Transformer架构实现。训练期间,随机遮盖两个个体的运动token并学习其预测。推理时,从完全遮盖的序列开始,逐步填充两个个体的token。凭借增强的运动表示、专用架构和有效的学习策略,InterMask实现了最先进的成果,生成高保真度和多样性的人类互动。在InterHuman数据集上实现了FID为(相较于in2IN的),在InterX数据集上实现了(相较于InterGen的)。此外,InterMask无需模型 redesign 或微调即可无缝支持反应生成。
引用
@article{arxiv.2410.10010,
title = {InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling},
author = {Muhammad Gohar Javed and Chuan Guo and Li Cheng and Xingyu Li},
journal= {arXiv preprint arXiv:2410.10010},
year = {2025}
}
备注
Project webpage: https://gohar-malik.github.io/intermask