SAVE:面向文本驱动视频编辑的谱偏移感知图像扩散模型适配方法
计算机视觉与模式识别
2023-12-04 v2
摘要
文本到图像(T2I)扩散模型在以文本提示为条件合成高质量图像方面取得了显著成功。近期的方法试图通过在大量文本-视频对上训练文本到视频(T2V)模型,或独立地在文本-视频对上适配 T2I 模型来复制这一成功。尽管后者计算开销较低,但针对每个视频的适配仍耗费大量时间。为解决此问题,我们提出 SAVE,一种新颖的谱偏移感知适配框架,其中我们对参数空间的谱偏移进行微调,而非参数本身。具体而言,我们对预训练 T2I 权重进行谱分解,仅更新奇异值同时冻结相应的奇异向量。此外,我们引入一种谱偏移正则化器,旨在对较大奇异值施加比小奇异值更紧的约束。这种正则化形式使模型能够掌握视频中与所给文本描述对齐的更精细细节。我们还为所提正则化技术提供了理论依据。由于我们仅处理谱偏移,所提方法显著减少了适配时间(约 10 倍)且训练的资源约束更少。这些特性使 SAVE 更适合实际应用,例如视频流期间编辑不良内容。我们在不同设置下(如风格迁移、物体替换、隐私保护等)通过广泛的实验评估验证了 SAVE 的有效性。
引用
@article{arxiv.2305.18670,
title = {SAVE: Spectral-Shift-Aware Adaptation of Image Diffusion Models for Text-driven Video Editing},
author = {Nazmul Karim and Umar Khalid and Mohsen Joneidi and Chen Chen and Nazanin Rahnavard},
journal= {arXiv preprint arXiv:2305.18670},
year = {2023}
}
备注
11 pages, 10 figures