SD-RSIC:摘要驱动的遥感图像描述生成
计算机视觉与模式识别
2020-10-14 v2 计算与语言
机器学习
摘要
深度神经网络(DNNs)近来在遥感(RS)图像描述生成问题中颇受欢迎。现有的基于 DNN 的方法依赖于由大量带描述文本的 RS 图像组成的训练集的可用性。然而,训练图像的描述可能包含冗余信息(它们可能彼此重复或语义相似),导致从图像域到语言域映射学习时的信息缺失。为克服此局限,本文提出一种新颖的摘要驱动遥感图像描述生成(SD-RSIC)方法。所提方法包含三个主要步骤。第一步通过联合利用卷积神经网络(CNNs)与长短期记忆(LSTM)网络获得标准图像描述。第二步不同于现有 RS 图像描述方法,利用序列到序列神经网络将每幅训练图像的 ground-truth 描述概括为单一描述,并消除训练集中的冗余。第三步基于图像的语义内容,自动定义与每幅 RS 图像相关的自适应权重,以将标准描述与概括描述相结合。这通过一种在 LSTM 网络背景下定义的新型自适应加权策略实现。在 RSCID、UCM-Captions 和 Sydney-Captions 数据集上的实验结果表明,与最先进的 RS 图像描述方法相比,所提方法有效。所提方法的代码公开于 https://gitlab.tubit.tu-berlin.de/rsim/SD-RSIC。
引用
@article{arxiv.2006.08432,
title = {SD-RSIC: Summarization Driven Deep Remote Sensing Image Captioning},
author = {Gencer Sumbul and Sonali Nayak and Begüm Demir},
journal= {arXiv preprint arXiv:2006.08432},
year = {2020}
}
备注
Accepted in the IEEE Transactions on Geoscience and Remote Sensing. For code visit: https://gitlab.tubit.tu-berlin.de/rsim/SD-RSIC