中文

MoTe: 学习运动-文本扩散模型以实现多任务生成

计算机视觉与模式识别 2024-12-02 v1 计算与语言 机器学习

摘要

近期,随着去噪扩散模型和大型语言模型等鼓舞人心的生成模型的出现,人类运动分析取得了显著进步。虽然现有方法主要关注生成带有文本描述的运动,却忽略了互为任务的另一方。本文提出了⚬MoTe⚬,一个统一的多模态模型,能够通过同时学习运动和文本的边缘分布、条件分布和联合分布来处理多样化任务。MoTe使我们能够通过简单修改输入上下文来处理配对文本-运动生成、运动描述和文本驱动运动生成。具体而言,MoTe由三个组件构成:运动编码器-解码器(MED)、文本编码器-解码器(TED)以及运动-文本扩散模型(MTDM)。其中,MED和TED分别用于提取潜在嵌入,并从提取的嵌入中重建运动序列和文本描述。MTDM则对输入上下文执行迭代去噪过程,以处理各种任务。实验结果表明,我们提出的方法在文本到运动生成任务上表现优异,在运动描述任务上表现具有竞争力。

关键词

引用

@article{arxiv.2411.19786,
  title  = {MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks},
  author = {Yiming Wu and Wei Ji and Kecheng Zheng and Zicheng Wang and Dong Xu},
  journal= {arXiv preprint arXiv:2411.19786},
  year   = {2024}
}

备注

Five figures, six tables