中文

词汇表外挑战报告

计算机视觉与模式识别 2022-09-15 v1

摘要

本文给出词汇表外 2022(OOV)挑战赛的最终结果。OOV 竞赛引入了一个未被光学字符识别(OCR)模型普遍研究的重要方面,即在训练时识别未见过的场景文本实例。该竞赛汇编了包含 326,385 张图像与 4,864,405 个场景文本实例的公开场景文本数据集集合,从而覆盖广泛的数据分布。形成了一组在训练时词汇表外的新且独立的验证集与测试集。竞赛结构为两个任务,分别为端到端与裁剪场景文本识别。文中给出了基线及不同参赛者的结果之详尽分析。有趣的是,当前最先进模型在这一新研究设定下表现出显著的性能差距。我们得出结论:本挑战提出的 OOV 数据集将是开发可实现更鲁棒与泛化预测的场景文本模型所必须探索的关键领域。

关键词

引用

@article{arxiv.2209.06717,
  title  = {Out-of-Vocabulary Challenge Report},
  author = {Sergi Garcia-Bordils and Andrés Mafla and Ali Furkan Biten and Oren Nuriel and Aviad Aberdam and Shai Mazor and Ron Litman and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2209.06717},
  year   = {2022}
}

备注

To be appeared in Text In Everything Workshop in ECCV 2022