EasyV2V:高质量指令式视频编辑框架
计算机视觉与模式识别
2025-12-19 v1 人工智能
摘要
尽管图像编辑取得了快速进展,视频编辑仍受到一致性、控制和泛化等挑战的制约。我们研究了数据、架构和控制的设计空间,提出 \emph{EasyV2V},一个简单有效的指令式视频编辑框架。在数据方面,我们组合现有专家模型及其快速逆变换以构建多样化的视频配对,利用单帧监督将图像编辑配对提升为视频,采用共享仿射运动的伪配对进行数据增强,挖掘密集描述的短片作为视频配对,并添加过渡监督教导编辑如何展开。在模型方面,我们发现预训练的文本到视频模型已具备编辑能力,这激发我们简化设计。简单的序列拼接用于条件编码,配合轻量 LoRA 微调即可训练出强大的模型。在控制方面,我们通过单一掩码机制统一时空控制,支持可选参考图像。总体而言,EasyV2V 支持灵活的输入形式,如 video+text、video+mask+text、video+mask+reference+text,实现了最先进的视频编辑效果,超越了同步方法和商业系统。项目页面:https://snap-research.github.io/easyv2v/。
引用
@article{arxiv.2512.16920,
title = {EasyV2V: A High-quality Instruction-based Video Editing Framework},
author = {Jinjie Mai and Chaoyang Wang and Guocheng Gordon Qian and Willi Menapace and Sergey Tulyakov and Bernard Ghanem and Peter Wonka and Ashkan Mirzaei},
journal= {arXiv preprint arXiv:2512.16920},
year = {2025}
}
备注
Project page: https://snap-research.github.io/easyv2v/