中文

DocEnTr:一种端到端文档图像增强 Transformer

计算机视觉与模式识别 2022-01-26 v1

摘要

文档图像会受到多种退化场景的影响,从而导致识别与处理困难。在数字化时代,为了正常使用这些图像,对其去噪十分重要。为应对这一挑战,我们提出了一种基于视觉 Transformer 的新编码器-解码器架构,以端到端方式增强机器打印与手写文档图像。编码器直接在带有位置信息的像素块上操作,不使用任何卷积层,而解码器从编码后的像素块重建干净图像。实验表明,在多个 DIBCO 基准上,所提模型优于当前最先进的方法。代码与模型将公开于:\url{https://github.com/dali92002/DocEnTR}。

关键词

引用

@article{arxiv.2201.10252,
  title  = {DocEnTr: An End-to-End Document Image Enhancement Transformer},
  author = {Mohamed Ali Souibgui and Sanket Biswas and Sana Khamekhem Jemni and Yousri Kessentini and Alicia Fornés and Josep Lladós and Umapada Pal},
  journal= {arXiv preprint arXiv:2201.10252},
  year   = {2022}
}

备注

submitted to ICPR 2022