中文

RVAFM: 用于手写段落文本识别的重参数化垂直注意力融合模块

计算机视觉与模式识别 2025-03-06 v1 人工智能

摘要

手写段落文本识别(HPTR)是计算机视觉领域的一项具有挑战性的任务,需要将富含手写文本的段落文本图像转换为文本编码序列。该任务最先进的模型之一是垂直注意力网络(VAN),它利用垂直注意力模块(VAM)将段落文本图像隐式地分割为文本行,从而降低识别任务的难度。然而,从网络结构角度来看,VAM 是单分支模块,其学习能力不如多分支模块。在本文中,我们提出了一种新模块——重参数化垂直注意力融合模块(RVAFM),它引入了结构重参数化技术。RVAFM 在训练和推理阶段解耦模块结构。训练阶段使用多分支结构以实现更有效的学习,推理阶段使用单分支结构以实现更快的处理。多分支结构学到的特征通过一种特殊的融合方法——重参数化融合(RF)——融合到单分支结构中,且不损失任何信息。因此,我们在 IAM 段落级测试集上实现了 4.44% 的字符错误率(CER)和 14.37% 的词错误率(WER)。此外,推理速度略快于 VAN。

关键词

引用

@article{arxiv.2503.03104,
  title  = {RVAFM: Re-parameterizing Vertical Attention Fusion Module for Handwritten Paragraph Text Recognition},
  author = {Jinhui Zheng and Zhiquan Liu and Yain-Whar Si and Jianqing Li and Xinyuan Zhang and Xiaofan Li and Haozhi Huang and Xueyuan Gong},
  journal= {arXiv preprint arXiv:2503.03104},
  year   = {2025}
}