用于改进历史文档图像增强的逐层 Tokens-to-Token Transformer 网络
计算机视觉与模式识别
2023-12-08 v1
摘要
文档图像增强是任何文档分析任务中实现最佳性能的基础且重要的阶段,因为存在许多可能损害文档图像的退化情况,使其识别与分析变得更加困难。在本文中,我们提出了 \textbf{T2T-BinFormer},这是一种基于 Tokens-to-token vision transformer 的新型文档二值化编码器-解码器架构。每张图像使用 ViT 模型被划分为一组具有设定长度的 token,随后多次应用该模型以捕捉 token 之间的全局关系。然而,输入数据的常规分词方法不能充分反映输入图像相邻像素间的关键局部结构,从而导致效率低下。在文档图像增强任务中,我们没有使用简单的 ViT 和图像的硬划分,而是采用渐进式分词技术从图像中捕捉局部信息,以获得更有效的结果。在多种 DIBCO 和 H-DIBCO 基准上的实验表明,所提出的模型优于现有的基于 CNN 和 ViT 的 SOTA 方法。本研究中主要考察的领域是将所提出的架构应用于文档二值化任务。源代码将在 https://github.com/RisabBiswas/T2T-BinFormer 上提供。
引用
@article{arxiv.2312.03946,
title = {A Layer-Wise Tokens-to-Token Transformer Network for Improved Historical Document Image Enhancement},
author = {Risab Biswas and Swalpa Kumar Roy and Umapada Pal},
journal= {arXiv preprint arXiv:2312.03946},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2312.03568