Object-WIPER:无训练的对象及其关联效应移除
计算机视觉与模式识别
2026-02-24 v2
摘要
本文提出Object-WIPER,一个无需训练的框架,用于从视频中移除动态对象及其关联视觉效应,并用语义一致、时序连贯的内容进行填充。该方法利用预训练的文本到视频扩散变换器(DiT)。给定输入视频、用户提供的对象掩码以及描述目标对象及其效应的查询标记,我们通过视觉-文本交叉注意力和视觉自注意力局部化相关视觉标记。此过程产生中间效应掩码,我们将其与用户掩码融合以获得最终的前景标记掩码用于替换。我们首先通过DiT对视频进行逆向处理以获得结构化噪声,然后对被标记的标记重新初始化为高斯噪声,同时保持背景标记。在去噪过程中,我们复制在逆向处理期间保存的背景标记值以保持场景保真。为解决缺乏合适评估的问题,我们引入一种新型对象移除指标,该指标奖励前景标记在连续帧之间的时序一致性、前景与背景标记在每个帧内的一致性以及输入与输出前景标记之间的不相似性。在DAVIS和新建构的真实世界关联效应基准(WIPER-Bench)上的实验表明,Object-WIPER在该指标上超越了所有训练基线,实现干净的移除和时序稳定的重构,且无需任何重新训练。我们新建构的基准、源码和预训练模型将公开可用。
引用
@article{arxiv.2601.06391,
title = {Object-WIPER : Training-Free Object and Associated Effect Removal in Videos},
author = {Saksham Singh Kushwaha and Sayan Nag and Yapeng Tian and Kuldeep Kulkarni},
journal= {arXiv preprint arXiv:2601.06391},
year = {2026}
}
备注
Accepted to CVPR 2026. Project Page: https://sakshamsingh1.github.io/object_wiper_webpage/