中文

VIVID-10M:面向通用与交互式视频局部编辑的数据集与基线模型

计算机视觉与模式识别 2025-07-15 v2 人工智能

摘要

近年来,扩散式图像编辑模型取得了显著进展。然而,实现高质量视频编辑仍是一大挑战。一个主要障碍是缺乏基于真实世界数据的开源大规模视频编辑数据集,因为构建此类数据集既耗时又昂贵。此外,视频数据需要大量token进行表示,这大大增加了视频编辑模型的训练成本。最后,当前的视频编辑模型提供的交互性有限,往往难以让用户一次性有效表达编辑需求。为此,本文引入数据集VIVID-10M和基线模型VIVID。VIVID-10M是首个大规模混合图像-视频局部编辑数据集,旨在降低数据构建和模型训练成本,包含970万样本,涵盖广泛的视频编辑任务。VIVID是一个基于VIVID-10M训练的Versatile and Interactive VIdeo local eDiting模型,支持实体添加、修改和删除。其核心提出了一种关键帧引导的交互式视频编辑机制,使用户能够迭代编辑关键帧并将其传递到其他帧,从而减少实现理想结果的延迟。广泛的实验评估表明,我们的方法在视频局部编辑方面实现了最先进的性能,在自动化指标和用户研究中均超越了基线方法。VIVID-10M数据集已开源发布于https://kwaivgi.github.io/VIVID/。

关键词

引用

@article{arxiv.2411.15260,
  title  = {VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing},
  author = {Jiahao Hu and Tianxiong Zhong and Xuebo Wang and Boyuan Jiang and Xingye Tian and Fei Yang and Pengfei Wan and Di Zhang},
  journal= {arXiv preprint arXiv:2411.15260},
  year   = {2025}
}

备注

10 pages, 10 figures