MagicStick:通过控制柄变换实现可控视频编辑
计算机视觉与模式识别
2024-11-19 v2
摘要
基于文本的视频编辑近期在改变风格或替换具有相似结构的对象方面引起了相当大的兴趣。除此之外,我们证明诸如形状、大小、位置、运动等属性也可以在视频中进行编辑。我们的关键见解在于,特定内部特征(例如,物体的边缘图或人体姿态)的关键帧变换可以轻松传播到其他帧以提供生成引导。因此,我们提出了MagicStick,这是一种可控视频编辑方法,通过利用提取的内部控制信号上的变换来编辑视频属性。具体来说,为了保持外观,我们将预训练的图像扩散模型和ControlNet膨胀到时间维度,并训练低秩适应(LoRA)层以适应特定场景。然后,在编辑过程中,我们执行一个反演与编辑框架。不同之处在于,微调后的ControlNet被引入到反演和生成过程中,通过提出的在反演和编辑的空间注意力图之间的注意力混合来进行注意力引导。尽管方法简洁,但我们的方法是首个展示从预训练文本到图像模型进行视频属性编辑能力的方法。我们在统一框架内对大量示例进行了实验。我们还与基于形状感知的文本编辑和手工制作的运动视频生成进行了比较,证明了我们相比先前工作在时间一致性和编辑能力上的优越性。代码和模型可在 https://github.com/mayuelala/MagicStick 获取。
引用
@article{arxiv.2312.03047,
title = {MagicStick: Controllable Video Editing via Control Handle Transformations},
author = {Yue Ma and Xiaodong Cun and Sen Liang and Jinbo Xing and Yingqing He and Chenyang Qi and Siran Chen and Qifeng Chen},
journal= {arXiv preprint arXiv:2312.03047},
year = {2024}
}
备注
Accepted by WACV 2025, Project page: https://magic-stick-edit.github.io/ Github repository: https://github.com/mayuelala/MagicStick