中文

面向开放集文本识别的标签到原型学习

计算机视觉与模式识别 2022-08-09 v3

摘要

场景文本识别是一个热门话题并在工业中广泛应用。尽管许多方法在闭集文本识别挑战上已取得令人满意的性能,这些方法在开放集场景中失去可行性,因为为新字符收集数据或重训练模型可能产生高昂成本。例如,为外语标注样本可能代价昂贵,而每当从历史文档中发现新字符就重训练模型则耗费时间与资源。本文引入并形式化了一项新的开放集文本识别任务,其要求具备无需重训练即可发现并识别新字符的能力。同时提出一个标签到原型学习框架作为该任务的基线。具体而言,该框架引入可泛化的标签到原型映射函数,为可见与不可见类别构建原型(类中心)。随后利用开放集预测器依据原型对样本进行识别或拒绝。对集外字符拒绝能力的实现允许在 incoming 数据流中自动发现未知字符。大量实验表明,我们的方法在多种零样本、闭集与开放集文本识别数据集上取得了有前景的性能。

关键词

引用

@article{arxiv.2203.05179,
  title  = {Towards Open-Set Text Recognition via Label-to-Prototype Learning},
  author = {Chang Liu and Chun Yang and Hai-Bo Qin and Xiaobin Zhu and Cheng-Lin Liu and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2203.05179},
  year   = {2022}
}

备注

V3 is a major revision of v2, should be close to the final form