面向零样本遥感图像场景分类的深度语义 - 视觉对齐
计算机视觉与模式识别
2024-02-06 v1 人工智能
摘要
深度神经网络在遥感 (RS) 图像分类方面取得了显著进展,但其训练过程需要每个类别都有大量的样本。然而,鉴于遥感目标数据库动态增长的事实,为每个遥感类别标注标签既耗时又不切实际。零样本学习 (ZSL) 允许识别训练期间未见过的新型类别,为上述问题提供了一种有前景的解决方案。然而,以往的 ZSL 模型主要依赖于人工标注的属性或从语言模型中提取的词嵌入,以将知识从可见类别迁移到新型类别。此外,早期的 ZSL 模型使用在 ImageNet 上预训练的卷积神经网络,这些网络专注于图像中出现的主要物体,而忽略了在遥感场景分类中同样重要的背景上下文信息。为解决上述问题,我们提出自动收集视觉可检测的属性。我们通过描绘属性与图像之间的语义 - 视觉相似性来预测每个类别的属性。通过这种方式,属性标注过程由机器完成,而非像其他方法那样由人工完成。此外,我们提出了一种深度语义 - 视觉对齐 (DSVA) 方法,利用 Transformer 中的自注意力机制将局部图像区域关联起来,整合背景上下文信息以进行预测。DSVA 模型进一步利用属性注意力图聚焦于对 ZSL 中知识迁移至关重要的信息丰富图像区域,并将视觉图像映射到属性空间以执行 ZSL 分类。大量实验表明,在一个具有挑战性的大规模遥感场景分类基准上,我们的模型大幅优于其他最先进 (SOTA) 模型。
引用
@article{arxiv.2402.02094,
title = {Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification},
author = {Wenjia Xu and Jiuniu Wang and Zhiwei Wei and Mugen Peng and Yirong Wu},
journal= {arXiv preprint arXiv:2402.02094},
year = {2024}
}
备注
Published in ISPRS P&RS. The code is available at https://github.com/wenjiaXu/RS_Scene_ZSL