中文

FineMoGen:细粒度时空运动生成与编辑

计算机视觉与模式识别 2023-12-27 v1

摘要

随着扩散模型的出现,文本驱动的运动生成取得了实质性进展。然而,现有方法仍然难以生成与细粒度描述相对应的复杂运动序列,以描绘详细且准确的时空动作。这种缺乏细粒度可控性的问题限制了运动生成在更广泛受众中的应用。为了应对这些挑战,我们提出了 FineMoGen,这是一个基于扩散模型的运动生成与编辑框架,能够根据用户指令进行时空组合,合成细粒度运动。具体而言,FineMoGen 在扩散模型的基础上构建了一种名为时空混合注意力(SAMI)的新型 Transformer 架构。SAMI 从两个角度优化了全局注意力模板的生成:1)显式建模时空组合的约束;2)利用稀疏激活的混合专家自适应地提取细粒度特征。为了促进对这一新的细粒度运动生成任务的大规模研究,我们贡献了 HuMMan-MoGen 数据集,该数据集包含 2,968 个视频和 102,336 条细粒度时空描述。大量实验验证了 FineMoGen 在运动生成质量上优于现有方法。值得注意的是,在现代大型语言模型(LLM)的辅助下,FineMoGen 进一步实现了零样本运动编辑能力,能够根据细粒度指令忠实地操控运动序列。项目页面:https://mingyuan-zhang.github.io/projects/FineMoGen.html

关键词

引用

@article{arxiv.2312.15004,
  title  = {FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing},
  author = {Mingyuan Zhang and Huirong Li and Zhongang Cai and Jiawei Ren and Lei Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2312.15004},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023