基于注意力控制的混合式潜在扩散视频编辑
计算机视觉与模式识别
2024-09-06 v1
摘要
由于缺乏完全公开可用的文本到视频模型,当前的视频编辑方法倾向于依赖于预训练的文本到图像生成模型,但仍面临在处理具有时序信息的局部编辑方面的巨大挑战。首先,尽管现有方法试图通过预定义的掩码来聚焦局部区域编辑,但由于每帧的空间整体生成,保持外部区域背景的保真度并不理想。其次,由用户特殊提供掩码是额外的负担,因此一种集成到编辑过程中的自主掩码策略是可取的。最后,图像级别的预训练模型尚未学习视频帧之间的时序信息,这对于表达运动和动态至关重要。本文提出了适用于局部视频编辑任务的图像级别混合式潜在扩散模型。具体而言,我们利用DDIM反演获取作为背景潜在表示的潜在向量,而非随机添加噪声的潜在向量,以更好地保留输入视频的背景信息。我们进一步引入了从扩散步骤中的交叉注意力图中派生的自主掩码制造机制。最后,通过将U-Net的自注意力块转换为时空注意力块,我们在视频帧之间增强了时序一致性。通过大量实验,我们的方法在不同实际视频编辑任务中展现出有效性。
引用
@article{arxiv.2409.03514,
title = {Blended Latent Diffusion under Attention Control for Real-World Video Editing},
author = {Deyin Liu and Lin Yuanbo Wu and Xianghua Xie},
journal= {arXiv preprint arXiv:2409.03514},
year = {2024}
}