中文

基于多头注意力的交互感知 Bangla 手写字符识别架构:引入一个基准数据集

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

字符识别是光学字符识别(OCR)系统的基础部分。通过字符识别,可以准确完成 word recognition、sentence transcription、document digitization 和 language processing 等更高阶活动。尽管如此,识别手写 Bangla 字符并不容易,因为它们以不同的 style 书写,笔画模式不一致且视觉字符相似性高。现有数据集通常在类内有限且类别分布不均。我们构建了一个新的平衡数据集,包含 Bangla 手写字符,旨� 解决上述问题。该数据集包含 78 个类别,每个类别约有 650 个样本。其中包含基本字符、复合(Juktobarno)字符和数字。样本来自年龄段和社会经济背景差异很大的群体:小学和高中学生、大学学生以及专业人士是主要贡献者。样本还包括右撇子和左撇子作家。我们进一步提出了一个交互感知混合 deep learning architecture,该 architecture 将 EfficientNetB3、Vision Transformer 和 Conformer 模块并行集成。通过 multi-head cross-attention fusion mechanism 实现对这些 components 之间有效的 feature interaction。该 model 在构建的数据集上实现了 98.84% 的准确率,在外部 CHBCR benchmark 上实现了 96.49% 的准确率,显示出强大的 generalization 能力。Grad-CAM 可视化进一步通过突出显示 discriminative 区域来提供可解释性。本 research 的 dataset 和 source code 已公开 disponible at https://huggingface.co/MIRZARAQUIB/Bangla_Handwritten_Character_Recognition。

关键词

引用

@article{arxiv.2604.09716,
  title  = {Training Deep Visual Networks Beyond Loss and Accuracy Through a Dynamical Systems Approach},
  author = {Hai La Quang and Hassan Ugail and Newton Howard and Cong Tran Tien and Nam Vu Hoai and Hung Nguyen Viet},
  journal= {arXiv preprint arXiv:2604.09716},
  year   = {2026}
}