ImVideoEdit:基于 2D 空间差分注意力块的图像学习视频编辑
计算机视觉与模式识别
2026-04-24 v2
摘要
当前的视频编辑模型通常依赖高昂的配对视频数据,限制了其实际可扩展性。从本质上看,大多数视频编辑任务可以表述为解耦的时空过程,即在保持预训练模型原始时序动态的同时,对空间内容进行选择性和精确修改。基于这一洞察,我们提出 ImVideoEdit,这是一个仅从图像对学习视频编辑能力的高效框架。通过冻结预训练的 3D 注意力模块并将图像视为单帧视频,我们将 2D 空间学习过程解耦,以帮助保留原始时序动态。我们方法的核心是预测-更新空间差分注意力模块,逐步提取并注入空间差异。我们不依赖刚性的外部掩码,而是引入基于文本的动态语义门控机制,以实现自适应且隐式的文本驱动修改。尽管仅用 13K 张图像对进行 5 个 epoch 的短暂训练且计算开销极低,ImVideoEdit 仍实现了与在大规模视频数据集上训练的大型模型相当的编辑保真度和时序一致性。
引用
@article{arxiv.2604.07958,
title = {ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks},
author = {Jiayang Xu and Fan Zhuo and Majun Zhang and Changhao Pan and Zehan Wang and Siyu Chen and Xiaoda Yang and Tao Jin and Zhou Zhao},
journal= {arXiv preprint arXiv:2604.07958},
year = {2026}
}