中文

用于场景文本文字系统识别的块聚合器

计算机视觉与模式识别 2019-12-10 v1

摘要

自然场景下的文字系统识别在多语言鲁棒阅读系统中具有重要意义。源自同一语系的文字系统共享大量字符,这使得文字系统识别成为一个细粒度分类问题。大多数现有方法致力于通过学习单一表示来结合局部特征,采用加权平均或其他聚类方法,这可能因冗余特征的干扰而削弱各文字系统中某些重要部分的判别力。本文提出一种名为块聚合器(PA)的新模块,它通过考虑局部块的预测分数来学习更具判别力的文字系统识别表示。具体而言,我们设计了一种基于 CNN 的方法,由标准 CNN 分类器和 PA 模块组成。实验表明,所提出的 PA 模块相较基线 CNN 模型带来了显著的性能提升,在三个文字系统识别基准数据集 SIW-13、CVSI 2015 和 RRC-MLT 2017 上取得了最先进的结果。

关键词

引用

@article{arxiv.1912.03818,
  title  = {Patch Aggregator for Scene Text Script Identification},
  author = {Changxu Cheng and Qiuhui Huang and Xiang Bai and Bin Feng and Wenyu Liu},
  journal= {arXiv preprint arXiv:1912.03818},
  year   = {2019}
}

备注

Accepted as ICDAR2019 oral