Follow-Your-Motion:通过高效时空解耦微调的视频运动迁移
计算机视觉与模式识别
2026-03-31 v4
摘要
最近,视频扩散Transformer领域的突破在多样化的运动生成方面展现了显著能力。至于运动迁移任务,当前方法主要使用两阶段低秩适应(LoRA)微调以获得更好的性能。然而,现有的基于微分的运动迁移在应用于大型视频扩散Transformer时仍面临运动不一致性和微调效率低下问题。朴素的两阶段LoRA微调由于3D注意力算子中固有的时空耦合,难以保持生成视频与输入视频之间的运动一致性。此外,它们在两个阶段都需要耗时的微调过程。为了解决这些问题,我们提出了Follow-Your-Motion,一个高效的两阶段视频运动迁移框架,用于微调强大的视频扩散Transformer以合成复杂运动。具体而言,我们提出了一种时空解耦LoRA,将注意力架构解耦为空间外观和时间运动处理。在第二阶段训练中,我们设计了稀疏运动采样和自适应RoPE以加速微调速度。为了解决该领域缺乏基准的问题,我们引入了MotionBench,一个包含多样化运动的综合基准,包括创意相机运动、单物体运动、多物体运动和复杂人体运动。我们在MotionBench上进行了广泛评估,以验证Follow-Your-Motion的优越性。
引用
@article{arxiv.2506.05207,
title = {Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning},
author = {Yue Ma and Yulong Liu and Qiyuan Zhu and Ayden Yang and Kunyu Feng and Xinhua Zhang and Zexuan Yan and Zhifeng Li and Sirui Han and Chenyang Qi and Qifeng Chen},
journal= {arXiv preprint arXiv:2506.05207},
year = {2026}
}
备注
Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/