中文

一种用于遥感图像描述的新型行动者双评论家模型

计算机视觉与模式识别 2020-10-06 v1 人工智能

摘要

我们利用深度强化学习的思想处理从光学遥感(RS)图像生成文本描述的问题。由于描述遥感数据的参考句子具有高度类间相似性,联合编码句子与图像会促使生成在语义上比许多情况下的真值更精确的描述。为此,我们引入一种行动者双评论家训练策略,其中第二个评论家模型以编码器-解码器 RNN 的形式部署,以编码对应于原始与生成描述的潜在信息。尽管所有行动者-评论家方法都使用行动者预测图像句子、评论家提供奖励,我们提出的编码器-解码器 RNN 通过句子到图像的翻译保证对图像的高层理解。我们观察到所提模型在测试数据上生成的句子与真值高度相似,并在许多关键情况下成功生成甚至更好的描述。在基准遥感图像描述数据集(RSICD)与 UCM-captions 数据集上的大量实验证实了该方法相较于先前最先进方法的优越性,我们在 ROUGE-L 与 CIDEr 度量上均获得了显著提升。

关键词

引用

@article{arxiv.2010.01999,
  title  = {A Novel Actor Dual-Critic Model for Remote Sensing Image Captioning},
  author = {Ruchika Chavhan and Biplab Banerjee and Xiao Xiang Zhu and Subhasis Chaudhuri},
  journal= {arXiv preprint arXiv:2010.01999},
  year   = {2020}
}

备注

8 pages, 21 figures Accepted at the International Conference on Pattern Recognition (ICPR) 2020