中文

训练协议至关重要:通过训练协议搜索实现精确的场景文本识别

计算机视觉与模式识别 2022-03-18 v2

摘要

深度学习时代场景文本识别(STR)的发展主要集中在 STR 模型的新颖架构上。然而,训练协议(即 STR 模型训练中所涉及超参数的设置)对于成功训练出优良的 STR 模型起着同等重要的作用,但在场景文本识别中却鲜有探究。在本工作中,我们试图通过搜索最优训练协议来提升现有 STR 模型的准确率。具体而言,我们开发了一种训练协议搜索算法,其基于新设计的搜索空间以及使用进化优化和代理任务的高效搜索算法。实验结果表明,我们搜索得到的训练协议能将主流 STR 模型的识别准确率提升 2.7%~3.9%。特别地,采用搜索得到的训练协议,TRBA-Net 比当前最先进的 STR 模型(即 EFIFSTR)准确率高出 2.1%,而在 CPU 和 GPU 上的推理速度分别快 2.3 倍和 3.7 倍。我们进行了大量实验以证明所提方法的有效性以及由我们的搜索方法发现的训练协议的泛化能力。代码已发布于 https://github.com/VDIGPKU/STR_TPSearch。

关键词

引用

@article{arxiv.2203.06696,
  title  = {Training Protocol Matters: Towards Accurate Scene Text Recognition via Training Protocol Searching},
  author = {Xiaojie Chu and Yongtao Wang and Chunhua Shen and Jingdong Chen and Wei Chu},
  journal= {arXiv preprint arXiv:2203.06696},
  year   = {2022}
}