基于多类型属性的开放集汉字识别
计算机视觉与模式识别
2018-08-29 v1
摘要
离线汉字识别仍是一个具有挑战性的问题,尤其在历史文献中,不仅因为类别数量相比当代图像检索方法极为庞大,而且在学习开放条件下(即便对 CNN 而言)可预期出现新的未见类别。具有零或极少训练样本的汉字识别是一个难题,尚未被研究。本文提出一种基于多类型属性的新汉字识别方法,属性依据汉字的发音、结构与偏旁部首,应用于历史书籍中的字符识别。这种中间属性编码相较于常见的“one-hot”类别表示具有显著优势,因为它允许利用属性以符号方式理解复杂与未见模式。首先,每个字符由四组属性类型表示以覆盖广泛的字符可能性:拼音标签、布局结构、笔画数、三种不同输入法如仓颉、郑码和五笔,以及四角编码法。训练卷积神经网络(CNN)以学习这些属性。随后,可利用距离度量与在属性空间中编码的完整词表通过这些属性轻松识别字符。我们在两个开放数据集上评估所提方法:用于零样本学习的印刷汉字识别、用于少样本学习的历史字符,以及一个闭集:手写汉字。实验结果显示对可见类别有良好的通用分类能力,同时对未见字符具有非常有前景的泛化能力。
引用
@article{arxiv.1808.08993,
title = {Open Set Chinese Character Recognition using Multi-typed Attributes},
author = {Sheng He and Lambert Schomaker},
journal= {arXiv preprint arXiv:1808.08993},
year = {2018}
}
备注
29 pages, submitted to Pattern Recognition