中文

InstructVEdit:面向指令式视频编辑的全方位方法

计算机视觉与模式识别 2025-03-25 v1

摘要

根据指令进行视频编辑是一个极具挑战性的任务,主要原因是难以收集大规模高质量的编辑视频配对数据。这种稀缺不仅限制了训练数据的可用性,也阻碍了系统性地探索模型架构和训练策略。虽然已有研究通过图像编辑技术合成视频数据集或采用分解式视频编辑训练等方式改进了视频编辑的特定方面,但尚无整体框架能系统性地解决上述挑战。本研究引入 InstructVEdit,一个完整的指令式视频编辑方法:(1) 建立可靠的数据 curated 流程以初始化训练;(2) 纳入两种模型架构改进,以提升编辑质量同时保持时间一致性;(3) 提出一种利用真实世界数据进行迭代细化的策略,以增强泛化性并最小化训练-测试差异。大量实验表明,InstructVEdit 在指令驱动的视频编辑中实现了最先进的性能,展现出对多样化真实场景的稳健适应能力。项目页面:https://o937-blip.github.io/InstructVEdit。

关键词

引用

@article{arxiv.2503.17641,
  title  = {InstructVEdit: A Holistic Approach for Instructional Video Editing},
  author = {Chi Zhang and Chengjian Feng and Feng Yan and Qiming Zhang and Mingjin Zhang and Yujie Zhong and Jing Zhang and Lin Ma},
  journal= {arXiv preprint arXiv:2503.17641},
  year   = {2025}
}

备注

https://o937-blip.github.io/InstructVEdit