中文

通过视频到视频翻译学习随机桥进行视频目标移除

计算机视觉与模式识别 2026-01-30 v3

摘要

现有的视频目标移除方法主要依赖于遵循噪声到数据范式的扩散模型,其生成过程从无信息的高斯噪声开始。这种方法丢弃了原始输入视频中存在的丰富结构和上下文先验。因此,此类方法往往缺乏足够的引导,导致目标擦除不完整或合成出与场景物理逻辑相冲突的不合理内容。在本文中,我们通过随机桥模型将视频目标移除重新表述为视频到视频的翻译任务。与从噪声初始化的方法不同,我们的框架建立了一条从源视频(含目标)到目标视频(目标已移除)的直接随机路径。这种桥接公式有效地利用了输入视频作为强结构先验,引导模型执行精确移除,同时确保填充区域与周围环境逻辑一致。为了解决强桥接先验阻碍大目标移除的权衡问题,我们提出了一种新颖的自适应掩码调制策略。该机制根据掩码特性动态调制输入嵌入,从而平衡背景保真度与生成灵活性。大量实验表明,我们的方法在视觉质量和时序一致性方面显著优于现有方法。项目页面为 https://bridgeremoval.github.io/。

关键词

引用

@article{arxiv.2601.12066,
  title  = {Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation},
  author = {Zijie Lou and Xiangwei Feng and Jiaxin Wang and Jiangtao Yao and Fei Che and Tianbao Liu and Chengjing Wu and Xiaochao Qu and Luoqi Liu and Ting Liu},
  journal= {arXiv preprint arXiv:2601.12066},
  year   = {2026}
}