古代韩国hanja手写文档文本识别增强
计算机视觉与模式识别
2024-12-17 v1
摘要
我们利用文档区域内高度可变的裁剪进行数据增强,实现了一个针对古代经典手写文档的高性能光学字符识别模型。在手写文档,尤其是古代经典文档中进行光学字符识别,由于其难度,一直是许多国家和研究机构面临的挑战性课题。尽管许多研究者已就此课题开展了研究,但古代文献随时间的质量变化以及各位作者独特的风格特征使其变得困难,而hanja手写文档的识别是一项有意义且特殊的挑战,特别是hanja在发展过程中反映了朝鲜王朝的词汇、语义和句法特征,与古代汉字有所不同。为研究这一挑战,我们使用了1100份草书文档(尺寸较小),并对每份文档通过裁剪随机大小的区域进行数据增强(每份文档增强100份),使用两阶段目标检测模型——高分辨率神经网络(HRNet)进行训练,并将训练得到的模型应用于草书文档,实现了高达90%的推理识别率。通过本研究,我们还确认OCR的性能受到简化字、变异字、异体字、常用字以及可互换汉字等汉字特征的影响,而这些在其他研究中难以观察到,并提出本研究的结果可应用于多语言现代文档的光学字符识别以及古代经典文档的其他字体。
引用
@article{arxiv.2412.10647,
title = {Enhancement of text recognition for hanja handwritten documents of Ancient Korea},
author = {Joonmo Ahna and Taehong Jang and Quan Fengnyu and Hyungil Lee and Jaehyuk Lee and Sojung Lucia Kim},
journal= {arXiv preprint arXiv:2412.10647},
year = {2024}
}