中文

InsEdit:基于数据高效视频扩散模型适配的指令式视觉编辑

计算机视觉与模式识别 2026-04-13 v1

摘要

指令式视频编辑是一种通过文本控制视频内容的自然方式,但将视频生成模型适配为编辑器通常需要大量数据。同时,高质量的视频编辑数据仍然稀缺。本文表明,无需大规模视频编辑数据,视频生成主干即可成为强大的视频编辑器。我们提出InsEdit,一个基于HunyuanVideo-1.5构建的指令式编辑模型。InsEdit结合了视觉编辑架构与基于互相上下文注意(MCA)的视频数据管道,后者创建对齐的视频对,使得编辑可以在片段中段部开始,而不仅限于第一帧。仅需O(100)K视频编辑数据,InsEdit在我们自己的视频指令编辑基准上实现了开源方法的SOTA成绩。此外,由于我们的训练配方还包括图像编辑数据,最终模型无需修改即可支持图像编辑。

关键词

引用

@article{arxiv.2604.08646,
  title  = {InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation},
  author = {Zhefan Rao and Bin Zou and Haoxuan Che and Xuanhua He and Chong Hou Choi and Yanheng Li and Rui Liu and Qifeng Chen},
  journal= {arXiv preprint arXiv:2604.08646},
  year   = {2026}
}

备注

13 pages, 10 figures