中文

ROSE:消除视频中具有副作用的对象

计算机视觉与模式识别 2025-08-27 v1 人工智能 机器学习

摘要

视频对象消除因近期视频生成模型的成功而取得了 advanced 的性能。然而,在处理对象的副作用时,例如阴影和反射,现有方法因缺乏配对视频数据作为监督而难以消除这些副作用。本文提出了 ROSE,即 Remove Objects with Side Effects(消除具有副作用的对象),一个系统性地研究对象对环境影响的框架,可将其分为五种常见情况:阴影、反射、光、半透明和镜面。鉴于整理呈现上述副作用的配对视频的挑战,我们利用 3D 渲染引擎进行合成数据生成。我们仔细构建了一个完全自动的数据准备管道,模拟了包含多样化场景、对象、拍摄角度和相机轨迹的大规模配对数据集。ROSE 实现为基于扩散转换器的视频 inpainting 模型。为局部化所有对象相关区域,整个视频输入模型进行基于参考的擦除。此外,引入额外的监督,以显式预测受副作用影响的区域,这些区域通过配对视频之间的差分掩码可被揭示。为全面评估各种副作用消除的模型性能,我们提出了一个新的基准,称为 ROSE-Bench,包含常见情景和五种特殊副作用。实验结果表明,ROSE 在与现有视频对象擦除模型的比较中取得优异性能,并在现实世界视频场景中表现出良好的泛化能力。项目页面为 https://rose2025-inpaint.github.io/。

关键词

引用

@article{arxiv.2508.18633,
  title  = {ROSE: Remove Objects with Side Effects in Videos},
  author = {Chenxuan Miao and Yutong Feng and Jianshu Zeng and Zixiang Gao and Hantang Liu and Yunfeng Yan and Donglian Qi and Xi Chen and Bin Wang and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2508.18633},
  year   = {2025}
}