是 i 还是 l:文本行识别模型的测试时自适应
计算机视觉与模式识别
2023-08-30 v1
摘要
从图像中识别文本行是一个具有挑战性的问题,尤其对于手写文档,由于书写风格差异很大。虽然文本行识别模型通常在大规模真实与合成数据语料上训练,但如果笔迹难以辨认或图像采集过程引入噪声、模糊、压缩等损坏,此类模型仍会频繁出错。个人的书写风格通常相当一致,可利用这一点来纠正此类模型所犯的错误。受此启发,我们引入在测试时自适应文本行识别模型的问题。我们关注一个具有挑战性且现实的设定:给定仅包含多行文本的单张测试图像,任务是在无任何标签的情况下使模型在该图像上表现更好。我们提出一种迭代自训练方法,利用语言模型的反馈来更新光学模型,在每次迭代中使用置信的自标注。置信度度量基于一种增强机制,评估模型在局部区域中预测的分歧。我们在多个基准数据集及其损坏版本上对所提方法进行了严格评估。在跨越多种文字的多个数据集上的实验结果表明,所提自适应方法仅需测试时少量几次自训练迭代,便可使字符错误率绝对提升高达 8%。
引用
@article{arxiv.2308.15037,
title = {Is it an i or an l: Test-time Adaptation of Text Line Recognition Models},
author = {Debapriya Tula and Sujoy Paul and Gagan Madan and Peter Garst and Reeve Ingle and Gaurav Aggarwal},
journal= {arXiv preprint arXiv:2308.15037},
year = {2023}
}