CMIR-NET:一种基于深度学习的遥感跨模态检索模型
图像与视频处理
2021-04-22 v2 计算机视觉与模式识别
信息检索
摘要
我们解决遥感领域的跨模态信息检索问题。具体而言,我们关注两种应用场景:i)全色(PAN)与多光谱影像之间的跨模态检索,以及 ii)甚高分辨率(VHR)图像与基于语音的标签标注之间的多标签图像检索。注意到这些多模态检索场景比传统的单模态检索方法更具挑战性,因为各模态间分布存在固有差异。然而,随着多源遥感数据日益可得而充足语义标注稀缺,多模态检索任务近期变得极为重要。对此,我们提出了一种新颖的基于深度神经网络的架构,其旨在为所有输入模态学习一个判别性的共享特征空间,适于语义一致的信息检索。我们在基准大规模 PAN-多光谱 DSRSID 数据集与多标签 UC-Merced 数据集上进行了充分实验。结合 Merced 数据集,我们生成了与标签对应的语音信号语料库。在所有情形下均观察到相对于当前 SOTA 的优越性能。
引用
@article{arxiv.1904.04794,
title = {CMIR-NET : A Deep Learning Based Model For Cross-Modal Retrieval In Remote Sensing},
author = {Ushasi Chaudhuri and Biplab Banerjee and Avik Bhattacharya and Mihai Datcu},
journal= {arXiv preprint arXiv:1904.04794},
year = {2021}
}