DreamVE:统一的基于指令的图像与视频编辑
计算机视觉与模式识别
2025-08-11 v1
摘要
基于指令的编辑因其简单高效的交互式编辑格式而拥有巨大潜力。然而,基于指令的编辑,特别是对于视频,一直受到训练数据有限的制约,阻碍了其实际应用。为此,我们引入了 DreamVE,一个用于基于指令的图像和视频编辑的统一模型。具体来说,我们提出了一种两阶段训练策略:首先是图像编辑,然后是视频编辑。这带来了两个主要好处:(1)图像数据更容易扩展,模型训练更高效,为更快、更好的视频编辑训练提供了有用的先验知识。(2)统一图像和视频生成是自然而然的,并且符合当前趋势。此外,我们提出了全面的训练数据合成流程,包括基于拼贴和基于生成模型的数据合成。基于拼贴的数据合成将前景对象和背景组合起来,生成多样化的编辑数据,例如对象操作、背景更改和文本修改。它可以轻松生成数十亿个准确、一致、逼真且多样化的编辑对。我们在广泛的基于拼贴的数据上预训练 DreamVE,以在关键编辑类型上实现强大性能,并增强泛化和迁移能力。然而,基于拼贴的数据缺乏某些属性编辑案例,导致性能相对下降。相比之下,基于生成模型的流程虽然难以扩展,但在处理属性编辑案例方面提供了灵活性。因此,我们使用基于生成模型的数据来进一步微调 DreamVE。此外,我们为 DreamVE 设计了一个高效且强大的编辑框架。我们基于最先进的 T2V 模型构建,并使用带有早期丢弃方法的令牌连接来注入源图像引导,确保强大的一致性和可编辑性。代码和模型将发布。
引用
@article{arxiv.2508.06080,
title = {DreamVE: Unified Instruction-based Image and Video Editing},
author = {Bin Xia and Jiyang Liu and Yuechen Zhang and Bohao Peng and Ruihang Chu and Yitong Wang and Xinglong Wu and Bei Yu and Jiaya Jia},
journal= {arXiv preprint arXiv:2508.06080},
year = {2025}
}