中文

SceneDiff:用于多视角目标变化检测的基准数据集与方法

计算机视觉与模式识别 2026-04-01 v2

摘要

我们研究了在同一场景在不同时间的成对捕获(图像或视频)之间,用于识别被添加、移除或移动的目标的问题。准确识别可验证的变化极具挑战性——一些目标可能因被遮挡或超出画面范围而显得缺失,而另一些目标则可能因视角变化而呈现不同外观。为研究此问题,我们引入了 SceneDiff 基准数据集,这是第一个包含沿不同相机轨迹捕获的场景多视角变化检测数据集,包含 350 对多样化视频对,标注了稠密的对象实例级注释。我们还引入了 SceneDiff算法,这是一种无需训练的方法,通过求解图像姿态、将图像分割为目标对象,并结合语义特征和几何特征进行比较。通过基于预训练模型的构建,SceneDiff 在无需重新训练的情况下可跨域泛化,并随底层模型的进步而自然提升。在多视角和两视角基准测试中实验表明,我们的方法在现有方法上实现了显著的提升(分别提高了 53.0% 和 30.6% 的相对平均精度)。项目页面:https://yuqunw.github.io/SceneDiff

关键词

引用

@article{arxiv.2512.16908,
  title  = {SceneDiff: A Benchmark and Method for Multiview Object Change Detection},
  author = {Yuqun Wu and Chih-hao Lin and Henry Che and Aditi Tiwari and Chuhang Zou and Shenlong Wang and Derek Hoiem},
  journal= {arXiv preprint arXiv:2512.16908},
  year   = {2026}
}