MotionEditor:通过内容感知扩散编辑视频运动
计算机视觉与模式识别
2023-12-01 v1
摘要
现有的基于扩散的视频编辑模型在随时间编辑源视频属性方面取得了出色进展,但难以在保留原始主角外观与背景的同时操控运动信息。为此,我们提出 MotionEditor,一种用于视频运动编辑的扩散模型。MotionEditor 将一种新颖的内容感知运动适配器(content-aware motion adapter)融入 ControlNet 以捕捉时间运动对应关系。尽管 ControlNet 能基于骨架姿态直接生成,但在反转噪声中修改源运动时,由于噪声(源)与条件(参考)之间的信号矛盾而面临挑战。我们的适配器通过引入源内容来无缝传递适配后的控制信号,从而补充 ControlNet。进一步,我们构建了具有高精度注意力注入机制的双分支架构(重建分支与编辑分支)以促进分支交互。该机制使编辑分支能以解耦方式查询重建分支的键与值,令编辑分支保留原始背景与主角外观。我们还提出一种骨架对齐算法,以解决姿态尺寸与位置上的差异。实验从定性与定量上均展示了 MotionEditor 良好的运动编辑能力。
引用
@article{arxiv.2311.18830,
title = {MotionEditor: Editing Video Motion via Content-Aware Diffusion},
author = {Shuyuan Tu and Qi Dai and Zhi-Qi Cheng and Han Hu and Xintong Han and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2311.18830},
year = {2023}
}
备注
18 pages, 15 figures. Project page at https://francis-rings.github.io/MotionEditor/