中文

UniMotion:面向运动、文本与视觉理解与生成的统一框架

计算机视觉与模式识别 2026-03-24 v1 人工智能

摘要

我们提出UniMotion,据称是首个同时处理人类运动、自然语言和RGB图像理解与生成的统一框架。现有统一模型仅处理受限的模态子集(如Motion-Text或静态Pose-Image),并且主要依赖离散标记化,导致量化误差并破坏时间连续性。UniMotion通过一种核心原则克服了这两个限制:将运动作为与RGB平等的第一类连续模态来对待。一种新颖的跨模态对齐运动变分自编码器 (CMA-VAE) 和对称双路径 embedder 在共享的LLM主干中构建运动和RGB的平行连续路径。为在不依赖图像的情况下将视觉语义先验注入运动表示,我们提出Dual-Posterior KL Alignment (DPA),它将来自视觉融合编码器更丰富的后验蒸馏到仅用于运动的编码器中。为解决文本监督alone 过于稀疏无法校准新引入的运动路径的 cold-start问题,我们进一步提出Latent Reconstruction Alignment (LRA),这是一种自监督预训练策略,使用稠密运动潜在变量作为明确的条件来共校准 embedder、主干和 flow head,建立稳定的运动感知基础,支持所有下游任务。UniMotion在覆盖三种模态中任何到任何理解、生成和编辑的七个任务上实现了最好的性能,尤其在跨模态组合任务上表现尤为突出。

关键词

引用

@article{arxiv.2603.22282,
  title  = {UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation},
  author = {Ziyi Wang and Xinshun Wang and Shuang Chen and Yang Cong and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2603.22282},
  year   = {2026}
}

备注

42 pages, 16 figures