FTMoMamba:基于频率和文本状态空间模型的运动生成
计算机视觉与模式识别
2024-11-27 v1
摘要
扩散模型在人类运动生成方面取得了显著的性能。然而,当前方法通常忽视了在潜在空间中捕捉细粒度运动的频率域信息的重要性(例如,低频率与静态姿态相关,高频率与细粒度运动对应)。此外,文本与运动之间存在语义差异,导致生成运动与文本描述之间不一致。本文提出了一种 novel 的扩散基方法 FTMoMamba 框架,配备频率状态空间模型(FreqSSM)和文本状态空间模型(TextSSM)。具体而言,为学习细粒度表示,FreqSSM 将序列分解为低频率和高频率分量,分别指导静态姿态(如坐姿、躺姿)和细粒度运动(如转身、踉跄)的生成。为确保文本与运动的一致性,TextSSM 在句子级别对文本特征进行编码,将文本语义与序列特征对齐。大量实验表明,FTMoMamba 在文本到运动生成任务上取得优异性能,尤其在 HumanML3D 数据集上实现了最低的 FID 分数 0.181(远低于 MLD 的 0.421)。
引用
@article{arxiv.2411.17532,
title = {FTMoMamba: Motion Generation with Frequency and Text State Space Models},
author = {Chengjian Li and Xiangbo Shu and Qiongjie Cui and Yazhou Yao and Jinhui Tang},
journal= {arXiv preprint arXiv:2411.17532},
year = {2024}
}
备注
8 pages, 6 figures