中文

基于选择性多模态 LSTM 的实例感知图像与句子匹配

计算机视觉与模式识别 2017-12-07 v1

摘要

有效的图像与句子匹配取决于如何良好地度量它们之间的全局视觉-语义相似度。基于这样一个观察:这种全局相似度源于图像(物体)与句子(词语)的成对实例之间多个局部相似度的复杂聚合,我们提出了一种用于实例感知图像与句子匹配的选择性多模态长短期记忆网络(sm-LSTM)。该 sm-LSTM 在每个时间步包含一个多模态上下文调制注意力方案,该方案通过预测图像和句子的成对实例感知显著图,能够选择性地关注图像与句子的一对实例。对于选定的成对实例,基于预测的显著图获得它们的表示,然后进行比较以度量其局部相似度。通过在几个时间步内类似地度量多个局部相似度,sm-LSTM 利用隐藏状态将它们顺序聚合,以获得一个最终的匹配分数,作为所需的全局相似度。大量实验表明,我们的模型能够很好地匹配具有复杂内容的图像和句子,并在两个公开基准数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.1611.05588,
  title  = {Instance-aware Image and Sentence Matching with Selective Multimodal LSTM},
  author = {Yan Huang and Wei Wang and Liang Wang},
  journal= {arXiv preprint arXiv:1611.05588},
  year   = {2017}
}