中文

利用图像描述生成器的深度图像表示

计算机视觉与模式识别 2017-05-26 v1

摘要

深度学习利用大量标注数据来学习强大的模型。当目标数据集较小时,通常的做法是使用预训练模型进行迁移学习,以学习新的任务特定表示。然而,用于图像识别的预训练卷积神经网络在训练期间仅获得关于图像的有限信息,即仅有标签。诸如场景检索等任务会受到这种弱监督所学习特征的影响,需要更强的监督来更好地理解图像内容。在本文中,我们利用从图像描述生成模型中学到的特征来学习新颖的任务特定图像表示。具体而言,我们考虑了最先进的描述系统 Show and Tell 和密集区域描述模型 DenseCap。我们证明,由于训练过程中提供的更丰富的监督,描述系统学到的特征表现优于卷积神经网络的特征。此外,我们训练了一个具有改进的成对损失的孪生网络,以融合 Show and Tell 和 DenseCap 学到的特征,并学习适用于检索的图像表示。实验表明,所提出的融合利用了各个特征的互补性质,在基准数据集上取得了最先进的检索结果。

关键词

引用

@article{arxiv.1705.09142,
  title  = {Deep image representations using caption generators},
  author = {Konda Reddy Mopuri and Vishal B. Athreya and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:1705.09142},
  year   = {2017}
}

备注

ICME 2017