DocEnTr:一种端到端文档图像增强 Transformer
计算机视觉与模式识别
2022-01-26 v1
摘要
文档图像会受到多种退化场景的影响,从而导致识别与处理困难。在数字化时代,为了正常使用这些图像,对其去噪十分重要。为应对这一挑战,我们提出了一种基于视觉 Transformer 的新编码器-解码器架构,以端到端方式增强机器打印与手写文档图像。编码器直接在带有位置信息的像素块上操作,不使用任何卷积层,而解码器从编码后的像素块重建干净图像。实验表明,在多个 DIBCO 基准上,所提模型优于当前最先进的方法。代码与模型将公开于:\url{https://github.com/dali92002/DocEnTR}。
引用
@article{arxiv.2201.10252,
title = {DocEnTr: An End-to-End Document Image Enhancement Transformer},
author = {Mohamed Ali Souibgui and Sanket Biswas and Sana Khamekhem Jemni and Yousri Kessentini and Alicia Fornés and Josep Lladós and Umapada Pal},
journal= {arXiv preprint arXiv:2201.10252},
year = {2022}
}
备注
submitted to ICPR 2022