中文

融合场景文本与视觉外观进行细粒度图像分类

计算机视觉与模式识别 2017-05-31 v2

摘要

自然图像中的文本包含丰富的语义,通常与物体或场景高度相关。本文专注于充分利用场景文本进行视觉理解的问题。主要思想是将词表示与深度视觉特征结合到一个可全局训练的深卷积神经网络中。首先,通过场景文本阅读系统获取识别出的单词。然后,我们将识别出的单词的词嵌入与深度视觉特征结合为单一表示,并通过卷积神经网络对其进行优化以用于细粒度图像分类。在我们的框架中,采用了注意力机制来揭示每个识别出的单词与给定图像之间的相关性,从而进一步提升识别性能。我们在两个数据集上进行了实验:分别为商业场所和饮料瓶细粒度分类而提出的 Con-Text 数据集和 Drink Bottle 数据集。实验结果一致表明,所提出的结合文本和视觉线索的方法显著优于仅使用视觉表示的分类方法。此外,我们展示了学习到的表示大幅提升了饮料瓶图像的检索性能,使其在产品搜索中具有潜在用途。

关键词

引用

@article{arxiv.1704.04613,
  title  = {Integrating Scene Text and Visual Appearance for Fine-Grained Image Classification},
  author = {Xiang Bai and Mingkun Yang and Pengyuan Lyu and Yongchao Xu and Jiebo Luo},
  journal= {arXiv preprint arXiv:1704.04613},
  year   = {2017}
}