Superman:统一骨架与视觉用于人类运动感知与生成
计算机视觉与模式识别
2026-02-03 v1
摘要
人类运动分析任务,如时间序列3D姿态估计、运动预测与运动插值,在计算机视觉中发挥着关键作用。然而,当前方法面临严重碎片化问题。首先,领域在“感知”模型与“生成”模型之间分化:感知模型能从视频中理解运动,但仅输出文本;生成模型则无法从原始视觉输入进行感知。其次,生成式多模态大语言模型(MLLM)常限于单帧静态姿态,使用稠密参数化SMPL模型,难以处理时序运动。再者,现有运动词汇仅基于骨架数据构建,割裂了与视觉领域的联系。为此,我们提出Superman,一个统一框架,桥接视觉感知与基于时序骨架的运动生成。我们的解决方案有两个方面:首先,为克服模态鸿沟,我们提出一种视觉引导的运动词典化器。利用3D骨架与视觉数据之间的自然几何对齐,此模块开创了从两种模态中进行联合学习的先河,构建统一的跨模态运动词汇。其次,基于此运动语言,我们训练一个统一的MLLM架构,涵盖所有任务。该模块灵活处理多样化的时序输入,统一了从视频中进行3D骨架姿态估计(感知)与基于骨架的运动预测与插值(生成)。在包括Human3.6M在内的标准基准测试上,我们的方法在所有运动任务中均实现最先进或竞争性的性能,展示了使用骨架进行生成式运动分析的更高效与可扩展路径。
引用
@article{arxiv.2602.02401,
title = {Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation},
author = {Xinshun Wang and Peiming Li and Ziyi Wang and Zhongbin Fang and Zhichao Deng and Songtao Wu and Jason Li and Mengyuan Liu},
journal= {arXiv preprint arXiv:2602.02401},
year = {2026}
}