中文

面向人类运动生成的语言引导 Transformer 分词器

计算机视觉与模式识别 2026-02-10 v1

摘要

本文聚焦于运动离散分词,将原始运动转换为紧凑的离散标记——这一过程已被证明对高效运动生成至关重要。在此范式下,增加标记数是提升运动重建质量的常见做法,但更多标记会使生成模型学习变得更加困难。为在保持高质量重建的同时降低生成复杂度,我们提出利用语言实现高效运动分词,称为语言引导分词(LG-Tok)。LG-Tok 在分词阶段将自然语言与运动对齐,生成紧凑的高层语义表示。这一方法不仅强化了分词与解分词,还简化了生成模型的学习。此外,现有分词器主要采用卷积架构,其局部感受野难以支持全局语言引导。为此,我们提出基于 Transformer 的分词器,利用注意力机制实现语言与运动的有效对齐。我们还设计了语言丢弃方案,在训练时随机移除语言条件,使解分词器能够在生成期间支持无语言引导。实验在HumanML3D和Motion-X生成基准上表现出色,LG-Tok 在Top-1得分上分别达到0.542和0.582,优于最新SOTA方法(MARDM: 0.500和0.528),FID得分分别为0.057和0.088,对比0.114和0.147。LG-Tok-mini仅使用一半的标记,却保持了具竞争力的性能(Top-1: 0.521/0.588,FID: 0.085/0.071),验证了我们的语义表示具有很好的效率。

关键词

引用

@article{arxiv.2602.08337,
  title  = {Language-Guided Transformer Tokenizer for Human Motion Generation},
  author = {Sheng Yan and Yong Wang and Xin Du and Junsong Yuan and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2602.08337},
  year   = {2026}
}