KISS:面向场景文本识别的极简设计
计算机视觉与模式识别
2019-11-20 v1
摘要
过去几年中,已有若干场景文本识别的新方法被提出。其中大多数方法为神经网络提出了新颖的构建模块。这些新颖的构建模块专为场景文本识别任务量身定制,因此几乎无法用于任何其他任务。本文中,我们引入一种仅由现成神经网络构建模块组成的场景文本识别新模型。我们的模型(KISS)由两个基于 ResNet 的特征提取器、一个空间变换器和一个 transformer 组成。我们仅在公开可用的合成训练数据上训练模型,并在一系列场景文本识别基准上评估它,尽管我们的模型未使用诸如 2D-attention 或图像校正等方法,仍达到了最先进或具竞争力的性能。
关键词
引用
@article{arxiv.1911.08400,
title = {KISS: Keeping It Simple for Scene Text Recognition},
author = {Christian Bartz and Joseph Bethge and Haojin Yang and Christoph Meinel},
journal= {arXiv preprint arXiv:1911.08400},
year = {2019}
}
备注
Code and Models available at https://github.com/Bartzi/kiss