中文

HTR-ConvText:利用卷积和文本信息进行手写文本识别

计算机视觉与模式识别 2025-12-05 v1 机器学习

摘要

手写文本识别(HTR)仍然具有挑战性,原因在于数据有限、书写风格差异大以及带有复杂变音符号的脚本。现有方法虽然部分解决了这些问题,但在没有大量合成数据的情况下往往难以泛化。为应对这些挑战,我们提出HTR-ConvText,一个旨在捕获细粒度笔画级局部特征同时保持全局上下文依赖的模型。在特征提取阶段,我们将残差卷积神经网络骨干与带位置编码的MobileViT块集成。这使模型既能捕获结构模式又能学习细微的书写细节。我们随后引入ConvText编码器,一种结合全局上下文和局部特征的混合架构,通过层次化结构减少序列长度以提高效率。此外,一个辅助模块注入文本上下文以缓解连接时序分类(Connectionist Temporal Classification, CTC)的弱点。在IAM、READ2016、LAM和HANDS-VNOnDB上的评估表明,我们的方法实现了性能提升和更好的泛化能力,特别是在训练样本有限和书写多样性高的场景中。

关键词

引用

@article{arxiv.2512.05021,
  title  = {HTR-ConvText: Leveraging Convolution and Textual Information for Handwritten Text Recognition},
  author = {Pham Thach Thanh Truc and Dang Hoai Nam and Huynh Tong Dang Khoa and Vo Nguyen Le Duy},
  journal= {arXiv preprint arXiv:2512.05021},
  year   = {2025}
}