中文

InstructVid2Vid:基于自然语言指令的可控视频编辑

计算机视觉与模式识别 2024-05-30 v2 人工智能 多媒体

摘要

我们提出 InstructVid2Vid,一种端到端的基于扩散模型的视频编辑方法,由人类语言指令引导。我们的方法支持由自然语言指令引导的视频操控,无需针对每个样本进行微调或反演。所提出的 InstructVid2Vid 模型修改了预训练图像生成模型 Stable Diffusion,以生成与时间相关的视频帧序列。通过利用不同模型的集体智能,我们构建了一个富含视频-指令三元组的训练数据集,这比在真实场景中收集数据更具成本效益。为增强生成视频中连续帧之间的一致性,我们提出了帧间一致性损失(Inter-Frames Consistency Loss)并在训练过程中加以引入。在推理阶段采用多模态无分类器引导(classifier-free guidance),生成的视频能够同时契合输入视频与伴随的指令。实验结果表明,InstructVid2Vid 能够生成高质量、时间连贯的视频,并执行多种编辑操作,包括属性编辑、背景更换与风格迁移。这些结果凸显了我们方法的通用性与有效性。

关键词

引用

@article{arxiv.2305.12328,
  title  = {InstructVid2Vid: Controllable Video Editing with Natural Language Instructions},
  author = {Bosheng Qin and Juncheng Li and Siliang Tang and Tat-Seng Chua and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2305.12328},
  year   = {2024}
}

备注

Accepted by ICME 2024