中文

NOVA:稀疏控制密集合成的无配对视频编辑

计算机视觉与模式识别 2026-03-04 v1

摘要

近期视频编辑模型取得了显著进展,但大多数仍需大规模配对数据集。收集此类天然对齐的配对数据在规模上仍具有高度挑战性,尤其是针对局部视频编辑数据。现有的解决方案通过全局运动控制将图像编辑迁移到视频,以实现无配对视频编辑,但此类设计在背景和时间一致性方面存在困难。本文提出了 NOVA:稀疏控制密集合成框架,用于无配对视频编辑。具体而言,稀疏分支通过用户在视频中分布的编辑关键帧提供语义指导,密集分支持续整合原视频的运动和纹理信息,以保持高保真度和一致性。此外,我们引入降解模拟训练策略,使模型能够通过训练人工降解视频来学习运动重建和时间一致性,从而无需配对数据。我们的大量实验表明,NOVA 在编辑保真度、运动保持和时间一致性方面均优于现有方法。

关键词

引用

@article{arxiv.2603.02802,
  title  = {NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing},
  author = {Tianlin Pan and Jiayi Dai and Chenpu Yuan and Zhengyao Lv and Binxin Yang and Hubery Yin and Chen Li and Jing Lyu and Caifeng Shan and Chenyang Si},
  journal= {arXiv preprint arXiv:2603.02802},
  year   = {2026}
}

备注

Accepted by CVPR 2026