InstructVid2Vid:基于自然语言指令的可控视频编辑
计算机视觉与模式识别
2024-05-30 v2 人工智能
多媒体
摘要
我们提出 InstructVid2Vid,一种端到端的基于扩散模型的视频编辑方法,由人类语言指令引导。我们的方法支持由自然语言指令引导的视频操控,无需针对每个样本进行微调或反演。所提出的 InstructVid2Vid 模型修改了预训练图像生成模型 Stable Diffusion,以生成与时间相关的视频帧序列。通过利用不同模型的集体智能,我们构建了一个富含视频-指令三元组的训练数据集,这比在真实场景中收集数据更具成本效益。为增强生成视频中连续帧之间的一致性,我们提出了帧间一致性损失(Inter-Frames Consistency Loss)并在训练过程中加以引入。在推理阶段采用多模态无分类器引导(classifier-free guidance),生成的视频能够同时契合输入视频与伴随的指令。实验结果表明,InstructVid2Vid 能够生成高质量、时间连贯的视频,并执行多种编辑操作,包括属性编辑、背景更换与风格迁移。这些结果凸显了我们方法的通用性与有效性。
引用
@article{arxiv.2305.12328,
title = {InstructVid2Vid: Controllable Video Editing with Natural Language Instructions},
author = {Bosheng Qin and Juncheng Li and Siliang Tang and Tat-Seng Chua and Yueting Zhuang},
journal= {arXiv preprint arXiv:2305.12328},
year = {2024}
}
备注
Accepted by ICME 2024