中文

LLaMo:通过连续自回归标记扩展预训练语言模型实现统一运动理解与生成

计算机视觉与模式识别 2026-04-20 v2

摘要

最近的大模型进展导致了在统一的多模态生成和理解方面取得了显著进展。然而,开发能够统一运动-语言生成和理解的模型仍在很大程度上未被探索。现有方法通常在配对运动-文本数据上微调大型语言模型(LLM),这可能会由于文本-运动对的规模有限而导致语言能力的灾难性遗忘。此外,先前的方法通常通过量化将运动转换为离散表示来与语言模型集成,引入了来自离散标记化的显著抖动伪影。为了解决这些挑战,我们提出了 LLaMo,一种通过特定于模态的混合转换器(Mixture-of-Transformers, MoT)架构扩展预训练 LLM 的统一框架。这种设计在本质上保留了基础模型的语言理解能力,同时实现了可扩展的多模态适应。我们将人类运动编码到因果连续潜在空间,并通过轻量级流匹配头维持解码器-only 主干体的下一个标记预测范式,实现实时(>30 FPS)的流式运动生成。利用预训练 LLM 的全面语言理解能力和大规模运动-文本预训练,我们的实验表明,LLaMo 在一般设置下实现了高保真的文本到运动生成和运动到文本描述,尤其是零样例运动生成,标志着通用统一运动-语言大模型的重要一步。

关键词

引用

@article{arxiv.2602.12370,
  title  = {LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens},
  author = {Zekun Li and Sizhe An and Chengcheng Tang and Chuan Guo and Ivan Shugurov and Linguang Zhang and Amy Zhao and Srinath Sridhar and Lingling Tao and Abhay Mittal},
  journal= {arXiv preprint arXiv:2602.12370},
  year   = {2026}
}

备注

Project page: https://kunkun0w0.github.io/project/LLaMo/