中文

若仅用真实数据集进行场景文本识别会怎样?迈向少标签场景文本识别

计算机视觉与模式识别 2021-06-08 v2

摘要

场景文本识别(STR)任务有一个常见做法:所有最先进的STR模型都在大型合成数据上训练。与此做法相反,仅用较少真实标签训练STR模型(少标签STR)在不得不无合成数据训练STR模型时十分重要:对于难以合成生成的手写或艺术文本,以及未必总有合成数据的非英语语言。然而,一直存在一种隐含的共识,即因真实数据不足,用真实数据训练STR模型几乎不可能。我们认为这一共识阻碍了少标签STR的研究。本工作中,我们通过证伪该共识来重启少标签STR研究。我们整合近期累积的公开真实数据,表明仅用真实标注数据即可满意地训练STR模型。随后,我们发现简单的数据增强可充分利用真实数据。进一步,我们通过收集无标签数据并引入半监督与自监督方法改进模型。结果,我们获得了与最先进方法竞争的模型。据我们所知,这是首项1)仅用真实标签即展示充足性能,且2)将半监督与自监督方法引入少标签STR的研究。我们的代码与数据可用:https://github.com/ku21fan/STR-Fewer-Labels

关键词

引用

@article{arxiv.2103.04400,
  title  = {What If We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer Labels},
  author = {Jeonghun Baek and Yusuke Matsui and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2103.04400},
  year   = {2021}
}

备注

CVPR 2021