中文

CMIR-NET:一种基于深度学习的遥感跨模态检索模型

图像与视频处理 2021-04-22 v2 计算机视觉与模式识别 信息检索

摘要

我们解决遥感领域的跨模态信息检索问题。具体而言,我们关注两种应用场景:i)全色(PAN)与多光谱影像之间的跨模态检索,以及 ii)甚高分辨率(VHR)图像与基于语音的标签标注之间的多标签图像检索。注意到这些多模态检索场景比传统的单模态检索方法更具挑战性,因为各模态间分布存在固有差异。然而,随着多源遥感数据日益可得而充足语义标注稀缺,多模态检索任务近期变得极为重要。对此,我们提出了一种新颖的基于深度神经网络的架构,其旨在为所有输入模态学习一个判别性的共享特征空间,适于语义一致的信息检索。我们在基准大规模 PAN-多光谱 DSRSID 数据集与多标签 UC-Merced 数据集上进行了充分实验。结合 Merced 数据集,我们生成了与标签对应的语音信号语料库。在所有情形下均观察到相对于当前 SOTA 的优越性能。

关键词

引用

@article{arxiv.1904.04794,
  title  = {CMIR-NET : A Deep Learning Based Model For Cross-Modal Retrieval In Remote Sensing},
  author = {Ushasi Chaudhuri and Biplab Banerjee and Avik Bhattacharya and Mihai Datcu},
  journal= {arXiv preprint arXiv:1904.04794},
  year   = {2021}
}