中文

利用构字树改进汉字表示

计算机视觉与模式识别 2024-04-22 v1 机器学习

摘要

学习有效的汉字表示面临独特的挑战,这主要由于庞大的字符数量及其持续增长,要求模型能够处理不断扩展的类别空间。此外,字符使用的固有稀疏性使已学表示的泛化变得复杂。先前的研究探索了基于部首的序列以克服这些问题,在识别未见字符方面取得了进展。然而,这些方法未能充分利用此类序列固有的树结构。为解决这些局限性并利用已确立的数据属性,我们提出了 Formation Tree-CLIP (FT-CLIP)。该模型利用构字树表示字符,并结合专用的树编码器,显著提升了已见和未见字符识别任务的性能。我们进一步对字符图像和树节点引入掩码,以实现高效且有效的训练。该方法显著加速了训练过程(2 倍或以上),同时提高了准确率。大量实验表明,通过构字树处理字符比直接序列方法更符合其固有属性,显著增强了表示的通用性和可用性。

关键词

引用

@article{arxiv.2404.12693,
  title  = {Improving Chinese Character Representation with Formation Tree},
  author = {Yang Hong and Yinfei Li and Xiaojun Qiao and Rui Li and Junsong Zhang},
  journal= {arXiv preprint arXiv:2404.12693},
  year   = {2024}
}