MotionAdapter:基于内容感知注意力定制的视频运动迁移
计算机视觉与模式识别
2026-04-08 v2
摘要
最近的扩散基文本到视频模型,特别是基于扩散变换器架构的模型,在生成高质量和时序连贯视频方面取得了显著进展。然而,在视频之间传递复杂运动仍然具有挑战性。本文提出了MotionAdapter,一种内容感知的运动迁移框架,使其能够在基于DiT的视频扩散模型中实现稳健且语义对齐的运动迁移。我们的关键洞察是,有效的运动迁移需要:1)从外观中显式地解耦运动,以及2)适应目标内容进行运动定制。MotionAdapter首先通过分析3D全注意力模块中的跨帧注意力,提取注意力派生的运动场,以隔离运动。为弥合参考视频与目标视频之间的语义差距,我们进一步引入了基于DINO的运动定制模块,依据内容对应关系重新排列和细化运动场。定制化的运动场用于引导DiT去噪过程,确保合成视频既继承参考运动,又保留目标的外观和语义。大量实验表明,MotionAdapter在定性和定量评估方面均优于当前最先进的方法。此外,MotionAdapter自然支持复杂运动迁移和运动编辑任务,如变焦和合成。
引用
@article{arxiv.2601.01955,
title = {MotionAdapter: Video Motion Transfer via Content-Aware Attention Customization},
author = {Zhexin Zhang and Yangyang Xu and Yifeng Zhu and Long Chen and Yong Du and Shengfeng He and Jun Yu},
journal= {arXiv preprint arXiv:2601.01955},
year = {2026}
}