中文

利用视觉基础模型与交叉注意力机制实现鲁棒的场景变化检测

计算机视觉与模式识别 2025-03-05 v3

摘要

我们提出了一种新颖的场景变化检测方法,该方法利用视觉基础模型 DINOv2 的鲁棒特征提取能力,并集成全图交叉注意力以解决光照变化、季节变化和视角差异等关键挑战。为了在变化检测任务中有效地学习图像对之间的对应与错对应关系,我们提出:a) “冻结”主干网络以保留稠密基础特征的通用性;b) 采用“全图”交叉注意力以更好地处理图像对之间的视角变化。我们在两个基准数据集 VL-CMU-CD 和 PSCD 及其视角变化版本上评估了我们的方法。实验表明,F1分数有显著提升,特别是在图像对之间涉及几何变化的场景中。结果表明,与现有的 SOTA 方法相比,我们的方法具有更出色的泛化能力,对光度变化和几何变化表现出鲁棒性,并且在微调以适应新环境时具有更好的整体泛化能力。详细的消融实验进一步验证了我们架构中各组件的贡献。源代码获取地址:https://github.com/ChadLin9596/Robust-Scene-Change-Detection。

关键词

引用

@article{arxiv.2409.16850,
  title  = {Robust Scene Change Detection Using Visual Foundation Models and Cross-Attention Mechanisms},
  author = {Chun-Jung Lin and Sourav Garg and Tat-Jun Chin and Feras Dayoub},
  journal= {arXiv preprint arXiv:2409.16850},
  year   = {2025}
}

备注

7 pages