面向场景文本识别的原语表示学习
计算机视觉与模式识别
2021-05-11 v1
摘要
由于自然场景图像中文本实例的多样化变化,场景文本识别是一项具有挑战性的任务。基于 CNN-RNN-CTC 或带注意力机制的编码器-解码器的传统方法可能未能充分挖掘多方向场景文本的稳定且高效的特征表示。本文提出一种原语表示学习方法,旨在利用场景文本图像的内在表示。我们将特征图中的要素建模为无向图的节点,提出一种池化聚合器与一种加权聚合器来学习原语表示,并通过图卷积网络将其转化为高层视觉文本表示。我们构建了原语表示学习网络(PREN)以利用视觉文本表示进行并行解码。此外,通过将视觉文本表示整合进带 2D 注意力机制的编码器-解码器模型,我们提出名为 PREN2D 的框架以缓解基于注意力的方法中的不对齐问题。在英文与中文场景文本识别任务上的实验结果表明,PREN 在准确率与效率间保持了平衡,而 PREN2D 取得了最先进的性能。
引用
@article{arxiv.2105.04286,
title = {Primitive Representation Learning for Scene Text Recognition},
author = {Ruijie Yan and Liangrui Peng and Shanyu Xiao and Gang Yao},
journal= {arXiv preprint arXiv:2105.04286},
year = {2021}
}