中文

用于印刷体汉字识别中零样本学习的部首分析网络

计算机视觉与模式识别 2018-03-30 v2 多媒体

摘要

汉字拥有庞大的字符类别集合,超过 20,000 个且数量仍在随着越来越多新字符被创造而增加。然而,海量汉字可分解为约 500 个紧凑的基本与结构部首集合。本文引入一种新颖的部首分析网络(RAN),通过识别部首并分析其间二维空间结构来识别印刷体汉字。所提 RAN 首先利用卷积神经网络作为编码器从输入中提取视觉特征。随后采用基于循环神经网络的解码器,旨在通过空间注意力机制检测部首与二维结构以生成汉字描述。将汉字视为部首组合而非单一字符类的方式大幅缩减了词表规模,并使 RAN 具备识别未见汉字类的能力,即零样本学习。

关键词

引用

@article{arxiv.1711.01889,
  title  = {Radical analysis network for zero-shot learning in printed Chinese character recognition},
  author = {Jianshu Zhang and Yixing Zhu and Jun Du and Lirong Dai},
  journal= {arXiv preprint arXiv:1711.01889},
  year   = {2018}
}

备注

Accepted by ICME2018