利用构字树改进汉字表示
计算机视觉与模式识别
2024-04-22 v1 机器学习
摘要
学习有效的汉字表示面临独特的挑战,这主要由于庞大的字符数量及其持续增长,要求模型能够处理不断扩展的类别空间。此外,字符使用的固有稀疏性使已学表示的泛化变得复杂。先前的研究探索了基于部首的序列以克服这些问题,在识别未见字符方面取得了进展。然而,这些方法未能充分利用此类序列固有的树结构。为解决这些局限性并利用已确立的数据属性,我们提出了 Formation Tree-CLIP (FT-CLIP)。该模型利用构字树表示字符,并结合专用的树编码器,显著提升了已见和未见字符识别任务的性能。我们进一步对字符图像和树节点引入掩码,以实现高效且有效的训练。该方法显著加速了训练过程(2 倍或以上),同时提高了准确率。大量实验表明,通过构字树处理字符比直接序列方法更符合其固有属性,显著增强了表示的通用性和可用性。
引用
@article{arxiv.2404.12693,
title = {Improving Chinese Character Representation with Formation Tree},
author = {Yang Hong and Yinfei Li and Xiaojun Qiao and Rui Li and Junsong Zhang},
journal= {arXiv preprint arXiv:2404.12693},
year = {2024}
}