中文

AnyMo:基于遮盖建模扩展任意模态条件运动生成

计算机视觉与模式识别 2026-05-29 v1 人工智能

摘要

条件人类运动生成始终是计算机视觉和机器人学中的根本性挑战。尽管取得了显著进展,当前方法往往受限于固定的模态配置和任务特定的体系结构,对跨模态相互作用和多模态条件合成的规模规律仍未充分探索。一个关键瓶颈是大规模模态对齐运动数据的稀缺,限制了在 diverse control signals 上的泛化。在本工作中,我们提出 OmniHuMo,一个包含超过 5000 小时运动和 320 万序列的大规模高质量数据集,具有精确对齐的多模态注释(如文本、语音、音乐和轨迹)。基于 OmniHuMo,我们提出 AnyMo,一个统一的多模态框架,结合基于 Residual FSQ 的运动标记化器和可扩展遮盖建模变换器,实现对任意模态组合的高质量运动合成。广泛的实验表明,AnyMo 能实现高保真合成,同时灵活控制空间和风格属性。

关键词

引用

@article{arxiv.2605.29488,
  title  = {AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling},
  author = {Yiheng Li and Zhuo Li and Ruibing Hou and Yingjie Chen and Hong Chang and Hao Liu and Shiguang Shan},
  journal= {arXiv preprint arXiv:2605.29488},
  year   = {2026}
}