中文

面向零样本手写中文字符识别的熵感知结构对齐

计算机视觉与模式识别 2026-02-11 v2 人工智能 机器学习

摘要

零样本手写中文字符识别(HCCR)旨在通过利用偏根语义组成来识别未见字符。然而,现有方法常将字符视为平坦的偏根序列,忽略了层次拓扑结构以及不同组件信息密度的不均衡。为此,本文提出一种熵感知结构对齐网络,通过信息论建模桥接视觉-语义鸿沟。首先,我们引入信息熵先验,通过乘法互作用动态调制位置嵌入,充当显著性检测器,优先识别判别性偏根而非常见组件。其次,我们构建双视图偏根树以提取多粒度结构特征,通过自适应 Sigmoid 门控网络集成,编码全局布局和局部空间角色。最后,设计了基于 Top-K 语义特征融合机制,通过利用语义邻居的质心来增强解码过程,有效通过特征层面的共识纠正视觉歧义。大量实验表明,我们的方法在 ICDAR 2013 数据集(m=1500m=1500)上建立了新的状态突破,准确率达 55.04%,显著优于在零样本设置下CLIP 基线方法。此外,该框架在数据效率方面表现突出,仅需每个类别一个支持样本即可实现 92.41% 的准确率。

关键词

引用

@article{arxiv.2602.03913,
  title  = {Entropy-Aware Structural Alignment for Zero-Shot Handwritten Chinese Character Recognition},
  author = {Qiuming Luo and Tao Zeng and Feng Li and Heming Liu and Rui Mao and Chang Kong},
  journal= {arXiv preprint arXiv:2602.03913},
  year   = {2026}
}

备注

34 pages, 8 figures