OMG:通过混合控制器迈向开放词汇运动生成
计算机视觉与模式识别
2024-03-20 v3
摘要
近期,我们在逼真的文本到运动生成方面取得了巨大进展。然而,现有方法在面对未见过的文本输入时往往会失败或产生不合常理的运动,这限制了其应用。在本文中,我们提出了 OMG,一个新颖的框架,它能够根据零样本开放词汇文本提示生成引人注目的运动。我们的核心思想是将“预训练-然后微调”范式精心调整并应用于文本到运动生成中。在预训练阶段,我们的模型通过学习丰富的域外固有运动特征来提升生成能力。为此,我们将一个大型无条件扩散模型扩展至 10 亿参数,以利用超过 2000 万个运动实例的海量无标签运动数据。在随后的微调阶段,我们引入了 motion ControlNet,它通过预训练模型的可训练副本和新提出的混合控制器块,将文本提示作为条件信息纳入其中。MoC 块通过交叉注意力机制自适应地识别各种范围的子运动,并通过特定于文本 token 的专家分别处理它们。这种设计有效地将文本提示的 CLIP token 嵌入与各种范围的紧凑且富有表现力的运动特征对齐。大量实验表明,我们的 OMG 在零样本文本到运动生成方面相较于 SOTA 方法取得了显著改进。项目页面:https://tr3e.github.io/omg-page。
关键词
引用
@article{arxiv.2312.08985,
title = {OMG: Towards Open-vocabulary Motion Generation via Mixture of Controllers},
author = {Han Liang and Jiacheng Bao and Ruichi Zhang and Sihan Ren and Yuecheng Xu and Sibei Yang and Xin Chen and Jingyi Yu and Lan Xu},
journal= {arXiv preprint arXiv:2312.08985},
year = {2024}
}
备注
accepted by CVPR 2024