中文

HAND:面向多尺度手写文档识别与布局分析的分层注意力网络

计算机视觉与模式识别 2024-12-30 v1 机器学习

摘要

手写文档识别 (HDR) 是计算机视觉领域最具挑战性的任务之一,由于手写文本中各种书写风格和复杂布局的固有特征。传统方法将其作为两个独立任务处理,即手写文本识别和布局分析,难以有效集成这两个过程。本文引入了 HAND (Multi-Scale Document的分层注意力网络),一种新型的端到端且无分割架构,用于同时完成文本识别和布局分析任务。我们的模型的关键组件包括集成 Gated Depth-wise Separable 和 Octave 卷积的高级卷积编码器,以实现稳健的特征提取;一个能够动态适应文档复杂性的多尺度自适应处理 (MSAP) 框架;以及具有记忆增强和稀疏注意力机制的分层注意力解码器。这些组件使我们的模型能够有效地从单行到三列页面进行扩展,同时保持计算效率。此外,HAND 采用跨五个复杂度水平的课程学习。为提高复杂古籍手稿的识别准确率,我们对 DOMAIN-ADAPTIVE PRE-TRAINED MT5 模型进行微调和集成,以用于后处理优化。在 READ 2016 数据集上的大量评估表明,HAND 在文本识别和布局分析方面性能卓越,实现了线级识别 CER 降低最高可达 59.8%,页级识别降低 31.2%。该模型保持紧凑的 5.60M 参数规模,同时在文本识别和布局分析方面均建立了新的基准。源代码和预训练模型均可在:https://github.com/MHHamdan/HAND 获取。

关键词

引用

@article{arxiv.2412.18981,
  title  = {HAND: Hierarchical Attention Network for Multi-Scale Handwritten Document Recognition and Layout Analysis},
  author = {Mohammed Hamdan and Abderrahmane Rahiche and Mohamed Cheriet},
  journal= {arXiv preprint arXiv:2412.18981},
  year   = {2024}
}