基于多模态大语言模型的语言驱动视频修复
计算机视觉与模式识别
2024-10-02 v2
摘要
我们引入了一项新任务——语言驱动视频修复,该任务使用自然语言指令来指导修复过程。这种方法克服了传统视频修复方法依赖人工标注二值掩码的局限性,后者通常是一个繁琐且费力的过程。我们提出了“按指令移除视频中物体”(ROVI)数据集,包含5,650个视频和9,091个修复结果,以支持该任务的训练和评估。我们还提出了一种新颖的基于扩散模型的语言驱动视频修复框架,这是该任务的首个端到端基线,集成了多模态大语言模型以有效理解和执行复杂的基于语言的修复请求。我们的综合结果展示了该数据集的多功能性以及模型在各种语言指令修复场景中的有效性。我们将公开数据集、代码和模型。
引用
@article{arxiv.2401.10226,
title = {Towards Language-Driven Video Inpainting via Multimodal Large Language Models},
author = {Jianzong Wu and Xiangtai Li and Chenyang Si and Shangchen Zhou and Jingkang Yang and Jiangning Zhang and Yining Li and Kai Chen and Yunhai Tong and Ziwei Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2401.10226},
year = {2024}
}
备注
CVPR-2024. Project Page: https://jianzongwu.github.io/projects/rovi