中文

HTR-JAND:基于联合注意力网络和知识蒸馏的手写文字识别

计算机视觉与模式识别 2024-12-25 v1

摘要

尽管深度学习取得了显著进展,当前的手写文字识别(HTR)系统仍在处理历史文档的固有复杂性方面存在挑战,包括多样化的书写风格、文本质量退化以及跨语言和跨时期的计算效率要求。本文引入 HTR-JAND(HTR-JAND:Handwritten Text Recognition with Joint Attention Network and Knowledge Distillation),这是一种高效 HTR 框架,结合了先进的特征提取与知识蒸馏。我们的体系结构包含三个关键组件:(1)集成 FullGatedConv2d 层和 Squeeze-and-Excitation 块的 CNN 架构,用于自适应特征提取;(2)融合 Multi-Head Self-Attention 与 Proxima Attention 的组合注意力机制,用于稳健的序列建模;(3)实现模型压缩同时保持准确性的知识蒸馏框架,通过基于课程的训练实现。HTR-JAND 框架采用多阶段训练方法,结合课程学习、合成数据生成和多任务学习,以实现跨数据集的知识迁移。我们通过上下文感知的 T5 后处理增强识别准确率,尤其适用于历史文档。全面评估表明 HTR-JAND 在 IAM、RIMES 和 Bentham 数据集上分别实现了 1.23%、1.02% 和 2.02% 的字符错误率(CER)。我们的学生模型在参数数量上实现了 48% 的减少(0.75M 参数 vs 1.5M 参数),通过高效知识迁移保持了具竞争力的性能。源代码和预训练模型均可在 \href{https://github.com/DocumentRecognitionModels/HTR-JAND}{Github} 上获取。

关键词

引用

@article{arxiv.2412.18524,
  title  = {HTR-JAND: Handwritten Text Recognition with Joint Attention Network and Knowledge Distillation},
  author = {Mohammed Hamdan and Abderrahmane Rahiche and Mohamed Cheriet},
  journal= {arXiv preprint arXiv:2412.18524},
  year   = {2024}
}