MotionGPT3:将人类运动作为第二模态
计算机视觉与模式识别
2025-11-04 v3 计算与语言
摘要
随着大语言模型(Large Language Model, LLM)的快速进步,统一理解与生成的多模态框架日益受到青睞,但随着模态数量和任务的增加,其复杂度也不断上升。我们注意到,运动量化会引入近似误差,限制运动质量;而将离散文本和连续运动统一到单一流式骨干网络中,会放大跨模态干扰。鼓舞于最近采用多分支Transformer设计(分离不同模态信号)的思路,我们提出MotionGPT3,一种双模态运动-语言模型,实现理解与生成。MotionGPT3使用变分自编码器(Variational Autoencoder, VAE)将原始运动编码为连续隐空间,从而避免量化引入的伪影,同时利用预训练语言模型的语义先验。采用双流Transformer架构,共享注意力机制保留模态特定的路径,同时实现受控的双向信息流动,从而降低干扰,稳定优化,并在不损失保真度的前提下实证加速收敛。对于多模态联合训练,采用生成后对齐的三阶段计划进一步提高稳定性,限制跨任务干扰。实验表明,MotionGPT3在训练损失中实现2倍的收敛速度,在验证集中实现最高4倍的收敛速度,同时保持在标准运动理解和运动生成基准任务上的领先性能。
引用
@article{arxiv.2506.24086,
title = {MotionGPT3: Human Motion as a Second Modality},
author = {Bingfan Zhu and Biao Jiang and Sunyi Wang and Shixiang Tang and Tao Chen and Linjie Luo and Youyi Zheng and Xin Chen},
journal= {arXiv preprint arXiv:2506.24086},
year = {2025}
}
备注
26 pages, 11 figures