迈向零样本字符识别:一个带有部首级标注的黄金标准数据集
计算机视觉与模式识别
2023-08-02 v1
摘要
光学字符识别(OCR)方法已被应用于多种任务,例如街景文本识别与文档分析。近来,零样本 OCR 引起了研究界的兴趣,因为它考虑了一种数据分布不平衡的实际 OCR 场景。然而,目前缺乏用于评估此类零样本方法的基准,这类方法通过把字符分解为部首来采用分而治之的识别策略。同时,部首识别作为另一项重要的 OCR 任务,也缺乏用于模型训练的部首级标注。本文中,我们构建了一个包含部首级与字符级标注的古代汉字图像数据集以满足上述方法的需求,即 ACCID,其中部首级标注包括部首类别、部首位置与结构关系。为增强 ACCID 的适应性,我们提出了一种基于拼接的合成字符算法以扩充训练样本,并应用图像去噪方法以改善图像质量。通过引入字符分解与重组,我们提出了一种零样本 OCR 的基线方法。实验结果从定量与定性上证明了 ACCID 及该基线模型的有效性。
引用
@article{arxiv.2308.00655,
title = {Toward Zero-shot Character Recognition: A Gold Standard Dataset with Radical-level Annotations},
author = {Xiaolei Diao and Daqian Shi and Jian Li and Lida Shi and Mingzhe Yue and Ruihua Qi and Chuntao Li and Hao Xu},
journal= {arXiv preprint arXiv:2308.00655},
year = {2023}
}
备注
Accepted by ACM MM 2023