SAFL:一种采用焦点损失的自注意力场景文本识别器
计算机视觉与模式识别
2022-01-04 v1 机器学习
摘要
近几十年来,场景文本识别因在广泛应用中的重要性而受到学术界与实际用户的广泛关注。尽管光学字符识别已取得成就,场景文本识别仍因畸变或不规则布局等固有问题而具挑战性。现有方法多主要依赖基于循环或卷积的神经网络。然而,循环神经网络(RNNs)常因序列计算导致训练缓慢,并遭遇梯度消失或瓶颈问题,而 CNN 则在复杂度与性能间权衡。本文引入 SAFL,一种基于自注意力并采用焦点损失(focal loss)的神经网络模型用于场景文本识别,以克服现有方法的局限。使用焦点损失替代负对数似然有助于模型更关注低频样本训练。此外,为处理畸变与不规则文本,我们利用空间变换网络(Spatial Transformer Network, STN)在送入识别网络前对文本进行校正。我们开展实验将所提模型与七个基准比较。数值结果表明我们的模型取得了最佳性能。
引用
@article{arxiv.2201.00132,
title = {SAFL: A Self-Attention Scene Text Recognizer with Focal Loss},
author = {Bao Hieu Tran and Thanh Le-Cong and Huu Manh Nguyen and Duc Anh Le and Thanh Hung Nguyen and Phi Le Nguyen},
journal= {arXiv preprint arXiv:2201.00132},
year = {2022}
}
备注
Accepted to ICMLA 2020