中文

LUMA:面向文本到运动扩散模型的低维统一运动对齐与双路径锚定

计算机视觉与模式识别 2025-10-01 v1

摘要

尽管当前基于扩散的模型(通常构建于U-Net架构之上)在文本到运动生成任务上展现出可喜的结果,但它们仍存在语义不对齐和运动学伪影的问题。通过分析,我们发现网络深层中严重的梯度衰减是一个关键瓶颈,导致对高层特征的学习不足。为解决这一问题,我们提出了\textbf{LUMA}(\textit{\textbf{L}ow-dimension \textbf{U}nified \textbf{M}otion \textbf{A}lignment}),一种结合双路径锚定以增强语义对齐的文本到运动扩散模型。第一条路径引入了一个轻量级的MoCLIP模型,该模型通过对比学习训练,无需依赖外部数据,在时域提供语义监督。第二条路径在频域引入互补对齐信号,该信号从以语义内容丰富著称的低频DCT分量中提取。这两个锚点通过时间调制机制进行自适应融合,使模型能够在整个去噪过程中逐步从粗对齐过渡到细粒度的语义精炼。在HumanML3D和KIT-ML上的实验结果表明,LUMA达到了SOTA性能,FID分数分别为0.035和0.123。此外,与基线相比,LUMA将收敛速度提升了1.4×\times,使其成为高保真文本到运动生成的一种高效且可扩展的解决方案。

关键词

引用

@article{arxiv.2509.25304,
  title  = {LUMA: Low-Dimension Unified Motion Alignment with Dual-Path Anchoring for Text-to-Motion Diffusion Model},
  author = {Haozhe Jia and Wenshuo Chen and Yuqi Lin and Yang Yang and Lei Wang and Mang Ning and Bowen Tian and Songning Lai and Nanqian Jia and Yifan Chen and Yutao Yue},
  journal= {arXiv preprint arXiv:2509.25304},
  year   = {2025}
}