GenEraser:通过平衡文本-掩码指导与解耦定位-保存器实现通用视频目标去除
计算机视觉与模式识别
2026-05-29 v1
摘要
视频目标去除在处理域外场景时,常常难以同时消除目标对象及其相关物理效应(如烟雾、反射、光线和涟漪), due to复杂时空歧义。现有方法主要依赖空间掩码,往往难以捕捉弱相关效应,且对显式文本指导的潜力尚未充分探索。此外,去除模型在高层语义泛化与像素级背景保持之间存在根本性优化冲突。为此,我们提出GenEraser——一个用于通用且高保真视频目标及效应去除的新框架。首先,引入多条件混合专家(MC-MoE)搭配双向文本指导,充分利用扩散变换器的多模态先验,显著提升复杂效应的识别。其次,开发可学习深度“CFG”融合机制(LD-CFG),在不同场景中自适应平衡掩码与文本条件的相对支配程度。最后,提出解耦专家架构,由定位器与保存器组成,以缓解语义泛化与像素对齐之间的内在权衡。大量实验表明,我们的GenEraser在多个最新SOTA方法上取得显著量化提升(如在ROSE基准和VOR-Eval上分别达到 dB和 dB),同时在开放世界场景中保持异常鲁健的泛化能力。
引用
@article{arxiv.2605.30045,
title = {GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver},
author = {Yuqing Chen and Lin Liu and Haisu Wu and Xiaopeng Zhang and Yaowei Wang and Yujiu Yang and Qi Tian},
journal= {arXiv preprint arXiv:2605.30045},
year = {2026}
}