DocTr:用于几何校正与光照校正的文档图像 Transformer
计算机视觉与模式识别
2022-10-11 v2
摘要
在这项工作中,我们提出了一个名为文档图像 Transformer (DocTr) 的新框架,以解决文档图像的几何和光照畸变问题。具体而言,DocTr 由一个几何校正 transformer 和一个光照校正 transformer 组成。通过设置一组学习到的查询嵌入,几何校正 transformer 通过自注意力机制捕获文档图像的全局上下文,并解码逐像素位移解以校正几何畸变。在几何校正之后,我们的光照校正 transformer 进一步去除阴影伪影,以提高视觉质量和 OCR 准确率。我们在几个数据集上进行了广泛的评估,并报告了优于 SOTA 方法的结果。值得注意的是,我们的 DocTr 实现了 20.02% 的字符错误率 (CER),比 SOTA 方法绝对提升了 15%。此外,它在运行时间和参数量上也表现出高效率。结果将发布在 https://github.com/fh2019ustc/DocTr 以供进一步比较。
引用
@article{arxiv.2110.12942,
title = {DocTr: Document Image Transformer for Geometric Unwarping and Illumination Correction},
author = {Hao Feng and Yuechen Wang and Wengang Zhou and Jiajun Deng and Houqiang Li},
journal= {arXiv preprint arXiv:2110.12942},
year = {2022}
}
备注
This paper has been accepted by ACM Multimedia 2021