EchoMotion:通过双模态扩散变换器实现统一的人类视频与动作生成
计算机视觉与模式识别
2025-12-23 v1
摘要
视频生成模型已取得显著进展,但仍难以合成复杂的人类动作,因为人类关节的自由度很高。这一限制源于像素唯一训练目标的内在约束,这些目标本质上偏向于对外观忠实性,而牺牲了学习底层运动学原理的能力。为此,我们引入 EchoMotion,一个旨在建模外观与人类动作联合分布的框架,从而提高复杂人类动作视频生成质量。EchoMotion 扩展了 DiT (扩散变换器) 框架,采用双分支架构联合处理来自不同模态的拼接标记。此外,我们提出了 MVS-RoPE (Motion-Video Syncronized RoPE),为视频和动作标记提供统一的三维位置编码。通过为双模态潜在序列提供同步坐标系,MVS-RoPE 建立了两种模态之间时间对齐的归纳偏置。我们还提出了 Motion-Video 两阶段训练策略。该策略使模型能够进行复杂人类动作视频及其对应动作序列的联合生成,以及灵活的跨模态条件生成任务。为训练具有这些能力的模型,我们构建了 HuMoVe 数据集,包含约80,000个高质量的人类中心视频-动作对。我们的发现表明,显式表示人类动作与外观表现是互补的,显著提升了人类中心视频生成的连贯性和合理性。
引用
@article{arxiv.2512.18814,
title = {EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer},
author = {Yuxiao Yang and Hualian Sheng and Sijia Cai and Jing Lin and Jiahao Wang and Bing Deng and Junzhe Lu and Haoqian Wang and Jieping Ye},
journal= {arXiv preprint arXiv:2512.18814},
year = {2025}
}
备注
26 pages, 16 figures