EffectErase:用于高质量特效消除的联合视频物体移除与插入
计算机视觉与模式识别
2026-03-20 v1
摘要
视频物体移除旨在消除动态目标物体及其视觉特效,如变形、阴影和反射,同时恢复无缝的背景。近期基于扩散的视频inpainting和物体移除方法可以移除物体,但往往难以消除这些特效且难以合成连贯的背景。除方法局限之外,进展还受到缺乏系统性捕获常见物体特效的综合数据集制约,此数据集用于训练和评估。为此,我们引入VOR(Video Object Removal),一个大型数据集,提供多样化的配对视频,每组视频包含一个目标物体存在且包含其特效的视频,以及其对应不包含物体和特效的视频,附带相应的物体掩码。VOR包含6万个高质量视频对,来自实际捕获和合成来源,覆盖五种特效类型,涵盖广泛的物体类别以及复杂的动态多物体场景。基于VOR,我们提出了EffectErase,一种面向特效感知的视频物体移除方法,将视频物体插入视为逆向辅助任务,纳入互惠学习框架中。该模型包含任务感知区域引导,聚焦受影响区域,实现灵活的任务切换。然后,引入插入-移除一致性目标,鼓励补充行为和特效区域及结构线索的共享定位。基于VOR训练的EffectErase在广泛的实验中实现卓越的性能,跨越多种场景,交付高质量的视频物体特效消除。
引用
@article{arxiv.2603.19224,
title = {EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing},
author = {Yang Fu and Yike Zheng and Ziyun Dai and Henghui Ding},
journal= {arXiv preprint arXiv:2603.19224},
year = {2026}
}
备注
CVPR 2026, Project Page: https://henghuiding.com/EffectErase/