中文

DocBinFormer:用于有效文档图像二值化的两层 Transformer 网络

计算机视觉与模式识别 2023-12-07 v1

摘要

在现实生活中,存在各种可能损害文档图像的退化场景,使其难以被识别和分析,因此二值化是在任何文档分析任务中实现最佳性能的基础且关键的一步。我们提出了 DocBinFormer(文档二值化 Transformer),一种基于视觉 Transformer 的新型两层视觉 Transformer(TL-ViT)架构,用于有效的文档图像二值化。该架构采用两层 Transformer 编码器,以有效地从输入图像中捕获全局和局部特征表示。这些互补的双层特征被用于高效的文档图像二值化,从而在系统生成和手写文档图像上均以全面的方式获得了改善的结果。在不存在卷积层的情况下,Transformer 编码器使用像素块和子块及其位置信息直接对其进行操作,而解码器则从这些块的潜在表示中生成干净(二值化)的输出图像。所提架构没有使用简单的视觉 Transformer 块从图像块中提取信息,而是使用了两个 Transformer 块,以在全局和局部尺度上更大范围地覆盖提取的特征空间。解码器块使用编码后的特征表示来生成相应的二值化输出。在多种 DIBCO 和 H-DIBCO 基准上的广泛实验表明,所提模型在四项指标上优于 SOTA 技术。源代码将在 https://github.com/RisabBiswas/DocBinFormer 上提供。

关键词

引用

@article{arxiv.2312.03568,
  title  = {DocBinFormer: A Two-Level Transformer Network for Effective Document Image Binarization},
  author = {Risab Biswas and Swalpa Kumar Roy and Ning Wang and Umapada Pal and Guang-Bin Huang},
  journal= {arXiv preprint arXiv:2312.03568},
  year   = {2023}
}