MagDiff:用于高保真视频生成与编辑的多对齐扩散模型
计算机视觉与模式识别
2024-07-16 v3 人工智能
摘要
扩散模型被广泛用于视频生成或视频编辑。由于每个领域都有其特定任务的问题,仅开发单一扩散模型来同时完成两项任务十分困难。单纯依赖文本提示的视频扩散可适用于统一这两项任务。然而,它缺乏对齐文本与图像之间异质模态的高能力,导致各种不对齐问题。在这项工作中,我们首次提出一种统一的多对齐扩散模型,称为 MagDiff,用于高保真视频生成与编辑两项任务。所提出的 MagDiff 引入了三种对齐方式,包括主体驱动对齐、自适应提示对齐和高保真对齐。特别地,主体驱动对齐被提出以权衡图像与文本提示,作为两项任务的统一基础生成模型。自适应提示对齐通过为图像与文本提示分配不同的权重值,来强调同质与异质对齐的不同强度。高保真对齐被开发以通过将主体图像作为额外模型输入来进一步增强视频生成与编辑的保真度。在四个基准上的实验结果表明,我们的方法在每项任务上均优于先前方法。
引用
@article{arxiv.2311.17338,
title = {MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing},
author = {Haoyu Zhao and Tianyi Lu and Jiaxi Gu and Xing Zhang and Qingping Zheng and Zuxuan Wu and Hang Xu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2311.17338},
year = {2024}
}