从理解到擦除:面向完整且稳定的视频对象移除
计算机视觉与模式识别
2026-04-03 v1
摘要
视频对象移除旨在消除视频中的目标对象,同时合理填充缺失区域并保持时空一致性。尽管扩散模型近期在此任务上取得进展,但仍面临挑战:若不牺牲整体连贯性,难以消除对象引起的副作用(如阴影、反射和光照变化)。这一限制源于对目标对象及其与场景相互作用的物理和语义理解不足。本文从两个互补角度引入理解:外部方面,我们提出一种蒸馏方案,将目标对象及其引发效应之间的关系从视觉基础模型转移到视频扩散模型;内部方面,我们提出帧际上下文交叉注意力机制,将每个去噪块 grounding 在目标区域周围的有信息、未遮蔽上下文中。外部与内部指导共同使模型能够理解目标对象、其引发的效应以及全局背景上下文,从而实现清晰且连贯的对象移除。大量实验表明,我们实现了最先进的性能,并建立了首个用于视频对象移除的真实世界基准,以推动未来研究和社区进步。我们的代码、数据和模型均可在 https://github.com/WeChatCV/UnderEraser 获取。
引用
@article{arxiv.2604.01693,
title = {From Understanding to Erasing: Towards Complete and Stable Video Object Removal},
author = {Dingming Liu and Wenjing Wang and Chen Li and Jing Lyu},
journal= {arXiv preprint arXiv:2604.01693},
year = {2026}
}