VIDiff:基于多模态指令与扩散模型的视频转译
计算机视觉与模式识别
2023-12-01 v1 人工智能
机器学习
多媒体
摘要
扩散模型在图像与视频生成中已取得显著成功。这激发了视频编辑任务中日益增长的研究兴趣,即根据提供的文本描述编辑视频。然而,大多数现有方法仅关注短片段的视频编辑,并依赖耗时的调优或推理。我们首次提出视频指令扩散(VIDiff),一种为广泛视频任务设计的统一基础模型。这些任务涵盖理解任务(如语言引导的视频对象分割)与生成任务(视频编辑与增强)。我们的模型可基于用户指令在数秒内编辑并转译所需结果。此外,我们设计了一种迭代自回归方法以确保长视频编辑与增强的一致性。我们为多样输入视频与书面指令提供了令人信服的生成结果,兼具定性与定量验证。更多示例见我们的网站 https://ChenHsing.github.io/VIDiff。
引用
@article{arxiv.2311.18837,
title = {VIDiff: Translating Videos via Multi-Modal Instructions with Diffusion Models},
author = {Zhen Xing and Qi Dai and Zihao Zhang and Hui Zhang and Han Hu and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2311.18837},
year = {2023}
}