SynMotion:语义-视觉适应的运动定制化视频生成模型
计算机视觉与模式识别
2026-04-29 v2
摘要
基于扩散模型的视频运动定制化技术能够从少量视频样本中获取人类运动表示,同时通过精确的文本条件实现任意主体迁移。现有方法通常依赖语义层面的对齐,期望模型学习新运动概念并将其与其他实体(如“猫”或“狗”)组合,以产生视觉上令人满意的结果。然而,视频数据涉及复杂的时空模式,仅关注语义会导致模型忽视运动的视觉复杂性。相反,仅调整视觉表征会导致对意图动作的表示产生语义混淆。为此,我们提出SynMotion——一种新的运动定制化视频生成模型,联合利用语义指导和视觉适应。在语义层面,我们引入双嵌入语义理解机制,以无缝分离主体与运动表征,使模型能够学习定制化运动特征,同时保留对多样化主体的生成能力。在视觉层面,我们将参数高效运动适配器集成到预训练的视频生成模型中,以增强运动保真度和时间一致性。此外,我们引入一种新的嵌入特定训练策略,通过交替优化主体嵌入和运动嵌入来实现上述目标,同时构建了人工构建的主体先验视频(SPV)训练数据集。该策略促进运动的特定性,同时保持跨多样化主体的泛化能力。最后,我们引入MotionBench——一个新构建的包含多样化运动模式的基准数据集。实验结果在T2V和I2V设置下均表明\method优于现有基线方法。项目页面:https://lucaria-academy.github.io/SynMotion/
引用
@article{arxiv.2506.23690,
title = {SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation},
author = {Shuai Tan and Biao Gong and Yujie Wei and Shiwei Zhang and Zhuoxin Liu and Ke Ma and Yan Wang and Kecheng Zheng and Xing Zhu and Yujun Shen and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2506.23690},
year = {2026}
}
备注
Project page: https://lucaria-academy.github.io/SynMotion/