面向高质量实时 3D 人体动作生成的残差量化层次因果 Transformer
计算机视觉与模式识别
2026-05-05 v4 人工智能
摘要
最近的基于 Transformer 的文本到动作生成技术取得了显著进展,使我们能够合成高质量的人体动作。然而,如何同时实现高保真度、流式传输、实时响应和可扩展性仍是根本性挑战。本文提出了 MOGO (Motion Generation with One-pass),一个专为高效和实时 3D 动作生成而设计的自回归框架。MOGO 包含两个关键组件:(1) MoSA-VQ,一种面向运动尺度自适应的残差向量量化模块,通过可学习的尺度对运动序列进行层次化离散化,以产生紧凑而富有表现力的表示;(2) RQHC-Transformer,一种残差量化层次因果 Transformer,在单次前向传递中生成多层运动标记,显著降低推理延迟。为增强语义保真度,我们进一步引入了文本条件对齐机制,以提高文本控制下的动作解码质量。在 HumanML3D、KIT-ML 和 CMP 等基准数据集上的大量实验表明,MOGO 在生成质量方面与最先进的基于 Transformer 的方法相当或更优,同时在实时性能、流式生成和零样本情境下的泛化方面实现了显著提升。
关键词
引用
@article{arxiv.2506.05952,
title = {MOGO: Residual Quantized Hierarchical Causal Transformer for High-Quality and Real-Time 3D Human Motion Generation},
author = {Dongjie Fu and Tengjiao Sun and Pengcheng Fang and Xiaohao Cai and Hansung Kim},
journal= {arXiv preprint arXiv:2506.05952},
year = {2026}
}
备注
9 pages, 4 figures, conference