中文

Video-P2P:基于交叉注意力控制的视频编辑

计算机视觉与模式识别 2023-03-09 v1

摘要

本文提出 Video-P2P,一种基于交叉注意力控制的真实世界视频编辑新框架。尽管注意力控制已被证明对使用预训练图像生成模型的图像编辑有效,但目前尚无公开的大规模视频生成模型可用。Video-P2P 通过适配一个图像生成扩散模型来完成各类视频编辑任务,从而解决此限制。具体而言,我们提出先微调一个文本到集合(T2S)模型以完成近似反演,再优化一个共享无条件嵌入,以较小内存代价实现准确的视频反演。对于注意力控制,我们引入一种新颖的解耦引导策略,对源提示与目标提示使用不同引导策略。为源提示优化的无条件嵌入提升了重建能力,而为目标提示初始化的无条件嵌入增强了可编辑性。融合这两支的注意力图可实现细致编辑。这些技术设计支持了多种文本驱动编辑应用,包括词语替换、提示精炼与注意力重加权。Video-P2P 在真实世界视频上表现良好,可生成新角色同时最优保留其原始姿态与场景。它显著优于先前方法。

关键词

引用

@article{arxiv.2303.04761,
  title  = {Video-P2P: Video Editing with Cross-attention Control},
  author = {Shaoteng Liu and Yuechen Zhang and Wenbo Li and Zhe Lin and Jiaya Jia},
  journal= {arXiv preprint arXiv:2303.04761},
  year   = {2023}
}

备注

10 pages, 9 figures. Project page: https://video-p2p.github.io/