Memory-V2V:基于记忆的视频到视频扩散模型用于一致的多轮编辑
计算机视觉与模式识别
2026-03-24 v2 人工智能
机器学习
摘要
视频到视频扩散模型在单轮编辑中取得了令人瞩目的性能,但实际编辑工作流程本质上是迭代式的。当编辑按顺序应用时,现有模型会独立处理每个步骤,常导致先前生成的区域漂移或被覆盖。我们识别了这种失效模式,即跨轮一致性问题的根源。我们提出 Memory-V2V,一种记忆增强框架,将先前的编辑视为后续生成的结构化约束。Memory-V2V 通过维护外部记忆存储先前输出,检索相关编辑,并通过关联感知标记化和自适应压缩将其集成,实现可扩展的条件化处理,避免计算随编辑轮数线性增长。我们在迭代视频新视角合成和文本引导的长视频编辑中展示了 Memory-V2V。该方法在保持视觉质量的同时显著提升跨轮一致性,凭借对强基线的适度开销实现了卓越的性能。
引用
@article{arxiv.2601.16296,
title = {Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing},
author = {Dohun Lee and Chun-Hao Paul Huang and Xuelin Chen and Jong Chul Ye and Duygu Ceylan and Hyeonho Jeong},
journal= {arXiv preprint arXiv:2601.16296},
year = {2026}
}
备注
Project page: https://dohunlee1.github.io/MemoryV2V