ChangeViT:释放纯视觉Transformer用于变化检测
计算机视觉与模式识别
2024-06-19 v1
摘要
遥感图像上的变化检测是跟踪地球表面环境变化的必不可少的手段。尽管视觉Transformer(ViTs)作为众多计算机视觉应用中的 backbone 已取得成功,但在变化检测中仍被 underutilize,因为卷积神经网络(CNN)因其强大的特征提取能力继续占据主导地位。本文的研究发现,ViTs在辨别大规模变化方面具有独特优势,而CNN在此方面不足。借此启发,我们介绍ChangeViT,一个采用纯ViT backbone 以提升大规模变化检测性能的框架。该框架配备一个细节捕获模块,用于生成详细的空间特征,以及一个特征注入器,用于高效地将细粒度空间信息整合到高层语义学习中。特征集成确保ChangeViT在检测大规模变化和捕获细粒度细节方面均表现出色,为跨尺度的综合变化检测提供了可能。不拖沓、华丽的装饰,ChangeViT在三个流行的高分辨率数据集(即LEVIR-CD、WHU-CD和CLCD)和一个低分辨率数据集(即OSCD)上实现了状态最佳的性能,这凸显了纯ViT用于变化检测的潜力。此外,详尽的定量和定性分析验证了所引入模块的有效性,坚实确立了我们方法的有效性。源代码可在 https://github.com/zhuduowang/ChangeViT 查阅。
关键词
引用
@article{arxiv.2406.12847,
title = {ChangeViT: Unleashing Plain Vision Transformers for Change Detection},
author = {Duowang Zhu and Xiaohu Huang and Haiyan Huang and Zhenfeng Shao and Qimin Cheng},
journal= {arXiv preprint arXiv:2406.12847},
year = {2024}
}