InsViE-1M: 基于详尽数据构建的有效指令式视频编辑
计算机视觉与模式识别
2025-07-14 v2
摘要
指令式视频编辑允许仅通过指令对视频进行有效且交互式的编辑,无需额外的掩码或属性输入。然而,收集高质量的训练三元组(源视频、编辑后视频、指令)是一个具有挑战性的任务。现有数据集大多由低分辨率、时长短且数量有限的源视频组成,且编辑质量不佳,限制了训练编辑模型的性能。本文提出了一个包含100万个三元组的高质量指令式视频编辑数据集,称为InsViE-1M。我们首先精选高分辨率且高质量的源视频和图像,然后设计一种有效的编辑筛选管道,用于构建模型训练的高质量编辑三元组。对于给定的源视频,我们生成其首帧的多个编辑样本,采用不同强度的分类器自由指导,这些样本会根据精心制定的准则自动通过GPT-4o进行筛选。经编辑后的首帧被传递到后续帧,以生成编辑后的视频,随后对帧质量和运动进行二次筛选。我们还生成并筛选来自高质量图像的多样化视频编辑三元组。凭借InsViE-1M数据集,我们提出一种多阶段学习策略来训练InsViE模型,逐步提升其指令遵循和编辑能力。大量实验表明,InsViE-1M数据集和训练后的模型相较于当前最先进的方法具有显著优势。代码可在\href{https://github.com/langmanbusi/InsViE}{InsViE}获取。
引用
@article{arxiv.2503.20287,
title = {InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction},
author = {Yuhui Wu and Liyi Chen and Ruibin Li and Shihao Wang and Chenxi Xie and Lei Zhang},
journal= {arXiv preprint arXiv:2503.20287},
year = {2025}
}
备注
Accepted by ICCV 2025