面向零样本学习的内存海马启发式汉字识别网络
计算机视觉与模式识别
2021-04-07 v1
摘要
由于汉字种类繁多且结构复杂,汉字识别一直是一项具有挑战性的任务。最新研究证明,如此庞大的字符集可分解为约500个基础汉字部首的集合,并基于此可有效解决该问题。然而随着新汉字的不断出现,基础部首的数量也在扩展。当前完全依赖已有部首的方法在识别这些新字符时缺乏灵活性,并且无法在训练阶段未学习其全部部首的情况下识别这些汉字。为此,本文提出一种新颖的海马启发式字符识别网络(HCRN),其参考了海马思维方式,仅通过训练部分部首即可识别未见过的汉字(即零样本学习)。更具体地,HCRN的网络架构是我们设计的一种新型伪孪生网络,可从成对的输入训练字符样本中学习特征,并用以预测未见过的汉字。实验结果表明HCRN鲁棒且有效。它仅依赖500个已训练汉字即可准确预测约16,330个未见测试汉字。在识别未见汉字方面,HCRN的识别准确率优于最先进的汉字部首识别方法15%(从85.1%提升至99.9%)。
引用
@article{arxiv.2104.02236,
title = {Hippocampus-heuristic Character Recognition Network for Zero-shot Learning},
author = {Shaowei Wang and Guanjie Huang and Xiangyu Luo},
journal= {arXiv preprint arXiv:2104.02236},
year = {2021}
}