中文

基于区域约束的情境生成指令视频编辑

计算机视觉与模式识别 2025-12-22 v1 多媒体

摘要

情境生成范式最近在指令图像编辑中展现出强大的数据效率和合成质量。然而,为指令式视频编辑塑造此类情境学习并不 trivial。若不指定编辑区域,结果可能 suffer from 编辑区域不准确的问题,以及在去噪过程中编辑区域与非编辑区域之间的 token 干扰。为此,我们提出了 ReCo,这是一种新的指令视频编辑范式,通过对情境生成期间编辑区域与非编辑区域之间的约束建模进行创新性探索。技术上,ReCo 将源视频和目标视频进行宽维度拼接,以进行联合去噪。为校准视频扩散学习,ReCo 利用两种正则化项,即潜在正则化和注意力正则化,分别针对一步向后去噪的潜在表示和注意力图进行操作。前者增加编辑区域源视频与目标视频之间的潜在差异,同时减少非编辑区域的差异,从而强化编辑区域的修改,减轻外部意外内容的生成。后者抑制编辑区域 token 对源视频对应区域 token 的注意力,从而在目标视频中新颖物体生成期间减轻其干扰。此外,我们提出了一个大规模高质量视频编辑数据集,即 ReCo-Data,包含 50 万指令-视频对,以促进模型训练。在针对四大指令式视频编辑任务进行的大量实验表明,我们的方案优于现有方法。

关键词

引用

@article{arxiv.2512.17650,
  title  = {Region-Constraint In-Context Generation for Instructional Video Editing},
  author = {Zhongwei Zhang and Fuchen Long and Wei Li and Zhaofan Qiu and Wu Liu and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2512.17650},
  year   = {2025}
}

备注

Project page: https://zhw-zhang.github.io/ReCo-page/