UniMo:基于自回归框架统一 2D 视频和 3D 人体动作
计算机视觉与模式识别
2025-12-04 v1
摘要
我们提出 UniMo,这是一个创新的自回归模型,用于在统一框架内联合建模 2D 人体视频和 3D 人体动作,首次实现这两种模态的同步生成与理解。当前方法主要聚焦于给定另一种模态作为条件生成另一种模态,或将其中一种与文本、音频等其他模态集成。将 2D 视频和 3D 动作进行同步优化和生成仍基本未探索,由于其显著的结构和分布差异,带来了显著挑战。灵感来自 LLM 统一不同模态的能力,我们的方法将视频和 3D 动作建模为统一的 token 序列,利用独立的嵌入层来缓解分布差距。此外,我们设计了一种序列建模策略,将两种不同任务整合到单个框架中,证明了统一建模的有效性。此外,为了高效对齐视觉 token 并保留 3D 空间信息,我们设计了一种带时间扩展策略的新型 3D 动作 tokenizer,使用单个 VQ-VAE 生成量化的动作 token。它包含多个专家解码器,用于处理身体形状、平移、全局姿态和身体姿态,以实现可靠的 3D 动作重建。广泛的实验表明,我们的方法在同时生成相应视频和动作的同时,能够进行精确的动作捕捉。这一工作触及了 LLM 融合多种数据类型的潜力,为将人类相关信息整合到现有模型中并 potentially 实现人类、物体和场景的多模态、可控联合建模开辟了道路。
引用
@article{arxiv.2512.03918,
title = {UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework},
author = {Youxin Pang and Yong Zhang and Ruizhi Shao and Xiang Deng and Feng Gao and Xu Xiaoming and Xiaoming Wei and Yebin Liu},
journal= {arXiv preprint arXiv:2512.03918},
year = {2025}
}
备注
https://carlyx.github.io/UniMo/