中文

TERDNet:面向场景变更检测的 Transformer 编码器-循环解码器网络

计算机视觉与模式识别 2026-05-21 v1

摘要

本文解决了场景变更检测(SCD)挑战,即识别两个相同位置不同时间拍摄的图像之间的差异。现有 SCD 模型常常忽视不同层次特征的重要性差异,采用单步骤解码器限制了细化能力,并对编码器预训练策略提供有限的见解。我们提出 TERDNet,一个 Transformer 编码器-循环解码器网络,用于克服上述局限性。TERDNet 包括基于 Transformer 的编码器提取多层次表示,一个特征融合模块将相关体积与这些特征相集成,一个 3 门 GRU 解码器进行迭代细化,以及一个结合卷积和插值的上采样器以恢复细粒度分辨率。在四个公共基准上的大量实验表明,TERDNet 持续优于先前方法,产生更准确、更详细的变更掩码。消融研究确认基于分段的预训练和我们融合设计的好处。此外,针对视角错位的鲁�棒性测试确认了 TERDNet 在实际机器人系统中部署的潜力,其中可靠的感知至关重要。我们的代码可在 https://github.com/AutoCompSysLab/TERDNet 查阅。

关键词

引用

@article{arxiv.2605.20822,
  title  = {TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection},
  author = {Jiae Yoon and Ue-Hwan Kim},
  journal= {arXiv preprint arXiv:2605.20822},
  year   = {2026}
}

备注

8 pages, 4 figures. Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026