中文

聚焦注意力:面向自然图像中的准确文本识别

计算机视觉与模式识别 2017-10-24 v3

摘要

场景文本识别因各种应用一直是计算机视觉中的热门研究课题。当前最先进的是基于注意力的编码器-解码器框架,以纯数据驱动方式学习输入图像与输出序列间的映射。然而,我们观察到现有基于注意力的方法在复杂和/或低质量图像上表现不佳。一个主要原因是现有方法无法为此类图像的特征区域与目标间获得准确对齐。我们称此现象为“注意力漂移(attention drift)”。为解决该问题,本文提出FAN(Focusing Attention Network的缩写)方法,采用聚焦注意力机制自动拉回漂移的注意力。FAN由两个主要组件构成:注意力网络(AN)负责如现有方法那样识别字符目标,以及聚焦网络(FN)负责通过评估AN是否恰当关注图像中目标区域来调整注意力。此外,不同于现有方法,我们采用基于ResNet的网络来丰富场景文本图像的深度表示。在包括IIIT5k、SVT和ICDAR数据集在内的多种基准上的大量实验表明,FAN方法大幅优于现有方法。

关键词

引用

@article{arxiv.1709.02054,
  title  = {Focusing Attention: Towards Accurate Text Recognition in Natural Images},
  author = {Zhanzhan Cheng and Fan Bai and Yunlu Xu and Gang Zheng and Shiliang Pu and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:1709.02054},
  year   = {2017}
}

备注

Revise the description of IC15 datasets (1811 samples)