STAR:基于笔画与部首级分解的零样本汉字识别
计算机视觉与模式识别
2022-10-18 v1
摘要
零样本汉字识别近年来受到越来越多的关注。现有解决该问题的方法主要基于某种低层级的笔画分解或中层的部首分解。考虑到笔画级与部首级分解可提供不同层级的信息,我们提出一种有效结合二者的零样本汉字识别方法。所提方法由训练阶段与推理阶段组成。在训练阶段,我们采用两个相似的编码器-解码器模型来生成笔画与部首编码的估计,并将其与真实编码一起用于构建相关的笔画与部首损失以进行训练。引入相似性损失来正则化笔画与部首编码器,使同一字符产生的特征具有高相关性。在推理阶段,引入笔画筛选模块(SSM)与特征匹配模块(FMM)两个关键模块,分别处理确定性与易混淆情形。特别地,我们在 FMM 中引入一种有效的笔画校正方案,以扩大最终推理的候选字符集。我们在涵盖手写、印刷艺术体和街景三种场景的三个基准数据集上进行了大量实验,以证明所提方法的有效性。数值结果表明,该方法在字符与部首零样本设定下均优于最先进的方法,并在传统已见字符设定下保持有竞争力的性能。
引用
@article{arxiv.2210.08490,
title = {STAR: Zero-Shot Chinese Character Recognition with Stroke- and Radical-Level Decompositions},
author = {Jinshan Zeng and Ruiying Xu and Yu Wu and Hongwei Li and Jiaxing Lu},
journal= {arXiv preprint arXiv:2210.08490},
year = {2022}
}
备注
24 pages