中文

HierCode:一种用于零样本中文文本识别的轻量级层次码本

计算机视觉与模式识别 2025-06-06 v1

摘要

文本识别,特别是对于像中文这样复杂的文字,因其复杂的字符结构和庞大的词汇量而面临独特的挑战。传统的独热编码方法难以处理层次部首的表示、集外词 (OOV) 字符的识别,并且由于计算量大而难以在设备端部署。为了解决这些挑战,我们提出了 HierCode,这是一种新颖且轻量级的码本,它利用了中文字符固有的层次特性。HierCode 采用多热编码策略,利用层次二叉树编码和原型学习为每个字符创建独特且信息丰富的表示。这种方法不仅通过利用共享的部首和结构促进了对 OOV 字符的零样本识别,而且通过计算与视觉特征的相似性,在线级识别任务中表现出色,这是相对于现有方法的一个显著优势。在包括手写、场景、文档、网页和古代文本在内的多种基准上的广泛实验,展示了 HierCode 在传统和零样本中文字符或文本识别方面的优越性,以显著更少的参数和快速的推理速度展现了最先进的性能。

关键词

引用

@article{arxiv.2403.13761,
  title  = {HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition},
  author = {Yuyi Zhang and Yuanzhi Zhu and Dezhi Peng and Peirong Zhang and Zhenhua Yang and Zhibo Yang and Cong Yao and Lianwen Jin},
  journal= {arXiv preprint arXiv:2403.13761},
  year   = {2025}
}