中文

MoLingo:用于文本到运动生成的运动-语言对齐

计算机视觉与模式识别 2026-03-27 v2

摘要

我们介绍 MoLingo,一个文本到运动(T2M)模型,通过在连续潜在空间中去噪生成逼真且具有生动感的人体运动。最近的工作对整个潜在空间或多个潜在空间进行潜在扩散,要么一次性,要么自回归方式。本文研究如何使连续运动潜在空间的扩散工作得最佳。我们关注两个问题:(1)如何构建语义对齐的潜在空间以使扩散更有效,(2)如何最佳地注入文本条件化,使运动更贴近描述。我们提出了一个使用帧级文本标签训练的语义对齐运动编码器,使具有相似文本意义的潜在向量保持接近,从而使潜在空间更适合扩散。我们还比较了单 token 条件化与多 token 跨注意力方案,发现跨注意力方案在运动真实性和文本-运动对齐方面表现更好。凭借语义对齐的潜在空间、自回归生成和跨注意力文本条件化,我们的模型在标准指标和用户研究中均设定了新的状态。我们将发布代码和模型供进一步研究和下游使用。

关键词

引用

@article{arxiv.2512.13840,
  title  = {MoLingo: Motion-Language Alignment for Text-to-Motion Generation},
  author = {Yannan He and Garvita Tiwari and Xiaohan Zhang and Pankaj Bora and Tolga Birdal and Jan Eric Lenssen and Gerard Pons-Moll},
  journal= {arXiv preprint arXiv:2512.13840},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Project page: https://hynann.github.io/molingo/MoLingo.html