中文

面向场景文本识别的特征混成

计算机视觉与模式识别 2022-12-06 v1

摘要

场景文本图像具有不同的形状并遭受多种畸变,例如透视畸变。为应对这些挑战,当前最优方法依赖于一个连接至文本识别网络的校正网络。它们构成线性流水线,对所有输入图像均使用文本校正,即便某些图像无需校正亦可被识别。无疑,校正网络提升了整体文本识别性能。然而在某些情况下,校正网络对图像产生不必要的畸变,导致本可在无校正时正确识别的图像出现错误预测。为缓解不必要的畸变,本文提出特征混成。受混成词启发,混成特征是一种同时包含原始文本图像与校正图像信息的特征。为生成混成特征,提出了一种带有分块矩阵初始化的非线性输入流水线。本工作中,选择 transformer 作为识别网络,因其利用注意力机制与固有并行性,可有效处理混成特征。所提方法在 6 个基准上进行了验证,并与 13 种当前最优方法比较。实验结果表明,该方法在多个基准上优于当前最优方法。

关键词

引用

@article{arxiv.2211.05036,
  title  = {Portmanteauing Features for Scene Text Recognition},
  author = {Yew Lee Tan and Ernest Yu Kai Chew and Adams Wai-Kin Kong and Jung-Jae Kim and Joo Hwee Lim},
  journal= {arXiv preprint arXiv:2211.05036},
  year   = {2022}
}

备注

Accepted in ICPR 2022