中国街景文本:基于部分监督学习的大规模中文文本读取
计算机视觉与模式识别
2020-02-14 v2 机器学习
多媒体
摘要
大多数现有文本读取基准因训练数据量有限,难以评估更先进深度学习模型在大规模词汇表中的性能。为解决此问题,我们引入一个名为中国街景文本(C-SVT)的新大规模文本读取基准数据集,包含 430,000 张街景图像,其规模至少为现有中文文本读取基准的 14 倍。为在野外识别中文文本同时保持大规模数据集标注的成本效益,我们提议对 CSVT 数据集的一部分(30,000 张图像)以位置与文本标签进行完整标注,并额外加入 400,000 张图像,其中仅给出区域中对应的感兴趣文本作为弱标注。为利用弱标注数据中的丰富信息,我们设计了一个处于部分监督学习框架中的文本读取网络,其能够定位与识别文本,并从完整与弱标注数据中同时学习。为从弱标注图像中定位最佳匹配文本提议,我们提出一个嵌入整个模型的在线提议匹配模块,通过共享参数进行端到端训练以 spotting 关键词区域。与全监督训练算法相比,该模型在相同标注成本下以 4.03% 的 F 值显著提升了端到端识别性能。所提模型在 ICDAR 2017-RCTW 数据集上亦可取得最先进结果,证明了所提部分监督学习框架的有效性。
引用
@article{arxiv.1909.07808,
title = {Chinese Street View Text: Large-scale Chinese Text Reading with Partially Supervised Learning},
author = {Yipeng Sun and Jiaming Liu and Wei Liu and Junyu Han and Errui Ding and Jingtuo Liu},
journal= {arXiv preprint arXiv:1909.07808},
year = {2020}
}
备注
ICCV 2019