中文

基于笔画的自编码器:用于高效零样本汉字识别的自监督学习器

计算机视觉与模式识别 2022-07-19 v1 人工智能

摘要

汉字蕴含丰富的形义信息;因此,汉字形体的语义增强已引起显著关注。以往方法旨在直接从整张汉字图像提取信息,通常无法同时捕获全局与局部信息。本文中,我们开发了基于笔画的自编码器(SAE),以自监督方法对汉字复杂形体建模。遵循其规范书写顺序,我们首先将汉字表示为一系列按固定书写顺序的笔画图像,随后训练我们的SAE模型重建该笔画图像序列。该预训练SAE模型只要未见汉字的笔画或部首曾出现在训练集中,即可预测其笔画图像序列。我们针对不同形式笔画图像设计了两种对比性SAE架构。其一在现有基于笔画的方法上微调,用于手写汉字的零样本识别;另一则用于从形体特征丰富中文词嵌入。实验结果验证,预训练后我们的SAE架构在零样本识别中优于其他现有方法,并以其丰富的形义信息增强了汉字的表示。

关键词

引用

@article{arxiv.2207.08191,
  title  = {Stroke-Based Autoencoders: Self-Supervised Learners for Efficient Zero-Shot Chinese Character Recognition},
  author = {Zongze Chen and Wenxia Yang and Xin Li},
  journal= {arXiv preprint arXiv:2207.08191},
  year   = {2022}
}

备注

10 pages, 13 figures