重新审视场景文本识别中的分类视角
计算机视觉与模式识别
2021-06-15 v3
摘要
场景文本识别的主流视角为序列到序列(seq2seq)与分割。然而,前者由许多组件构成,使实现与部署复杂化;而后者需要字符级标注,成本高昂。本文中,我们重新审视将场景文本识别建模为图像分类问题的分类视角。分类视角具有简单流程,且仅需词级标注。我们通过设计名为 CSTR 的场景文本识别模型来复兴分类视角,其性能与其他视角的方法相当。CSTR 模型由 CPNet(分类视角网络)与 SPPN(分离卷积加全局平均池化预测网络)组成。CSTR 如同 ResNet \cite{he2016deep} 等图像分类模型一样简单,易于实现与部署。我们通过大量实验证明了分类视角在场景文本识别上的有效性。此外,CSTR 在包括规则文本与不规则文本在内的六个公开基准上取得了近乎最先进的性能。代码将发布于 https://github.com/Media-Smart/vedastr。
引用
@article{arxiv.2102.10884,
title = {Revisiting Classification Perspective on Scene Text Recognition},
author = {Hongxiang Cai and Jun Sun and Yichao Xiong},
journal= {arXiv preprint arXiv:2102.10884},
year = {2021}
}
备注
10 pages, 4 figures