中文

更关注显著性:结合显著性与上下文注意力的图像描述生成

计算机视觉与模式识别 2018-05-22 v4

摘要

图像描述生成近来因深度描述架构所取得的令人瞩目的成就而备受关注,这些架构结合了卷积神经网络提取图像表示和循环神经网络生成相应描述。与此同时,大量研究工作致力于开发能够预测人眼注视点的显著性预测模型。尽管显著性信息可以通过指示图像中哪些部分显著、哪些部分不显著,从而为图像描述架构提供有益的条件信息,但研究仍难以将这两种技术融合。在这项工作中,我们提出了一种图像描述方法,其中生成式循环神经网络在生成描述的过程中,可以利用显著性预测模型提供的关于图像哪些部分显著、哪些部分是上下文的条件信息,聚焦于输入图像的不同区域。我们通过在大规模数据集上进行广泛的定量和定性实验表明,相较于使用和不使用显著性的描述基线模型,以及结合显著性和描述的不同现有先进方法,我们的模型取得了更优的性能。

关键词

引用

@article{arxiv.1706.08474,
  title  = {Paying More Attention to Saliency: Image Captioning with Saliency and Context Attention},
  author = {Marcella Cornia and Lorenzo Baraldi and Giuseppe Serra and Rita Cucchiara},
  journal= {arXiv preprint arXiv:1706.08474},
  year   = {2018}
}

备注

ACM Transactions on Multimedia Computing, Communications and Applications, Vol. 14, No. 2, Article 48