HTR-VT:基于 Vision Transformer 的手写文本识别
计算机视觉与模式识别
2024-09-16 v1
摘要
我们探索了 Vision Transformer(ViT)在手写文本识别中的应用。该领域标注数据的有限可用性给仅依靠 ViT 实现高性能带来了挑战。以往基于 Transformer 的模型需要外部数据或在大型数据集上进行广泛的预训练才能表现出色。为了解决这一局限性,我们引入了一种数据高效的 ViT 方法,该方法仅使用标准 Transformer 的编码器。我们发现,采用卷积神经网络(CNN)进行特征提取来代替原始的 patch embedding,并使用 Sharpness-Aware Minimization(SAM)优化器,可以确保模型收敛到更平坦的极小值,并产生显著的提升。此外,我们引入的 span mask 技术掩盖了特征图中相互连接的特征,起到了有效的正则化作用。从实验上看,我们的方法在 IAM 和 READ2016 等小数据集上与传统基于 CNN 的模型相比表现出色。此外,它在 LAM 数据集上建立了新的基准,该数据集是目前最大的数据集,包含 19,830 行训练文本。代码公开于:https://github.com/YutingLi0606/HTR-VT。
引用
@article{arxiv.2409.08573,
title = {HTR-VT: Handwritten Text Recognition with Vision Transformer},
author = {Yuting Li and Dexiong Chen and Tinglong Tang and Xi Shen},
journal= {arXiv preprint arXiv:2409.08573},
year = {2024}
}
备注
Accepted to Pattern Recognition