各种基于深度学习的文档图像二值化方法的公平评估
计算机视觉与模式识别
2024-01-23 v1
摘要
文档图像二值化是文档分析领域中的一个重要预处理步骤。传统的图像二值化技术通常依赖于直方图或局部统计来识别有效阈值,以区分图像的不同方面。深度学习技术能够通过学习上下文相关的特征来生成图像的二值化版本,这些特征对文档图像中常见的退化具有较低的误差。近年来,许多基于深度学习的文档二值化方法被开发出来。但应该选择哪一种?目前还没有研究对这些方法进行严格比较。因此,本工作侧重于在同一评估协议下评估不同的深度学习方法。我们在不同的文档图像二值化竞赛(DIBCO)数据集上评估它们,并获得了非常异质的结果。我们表明,在DIBCO2013数据集上评估时,DE-GAN模型比其他模型表现更好,而DP-LinkNet在DIBCO2017数据集上表现最佳。2-StageGAN在DIBCO2018数据集上表现最佳,而SauvolaNet在DIBCO2019挑战中优于其他模型。最后,我们公开了代码、所有模型和评估结果(https://github.com/RichSu95/Document_Binarization_Collection),以确保可重复性并简化未来的二值化评估。
引用
@article{arxiv.2401.11831,
title = {A Fair Evaluation of Various Deep Learning-Based Document Image Binarization Approaches},
author = {Richin Sukesh and Mathias Seuret and Anguelos Nicolaou and Martin Mayr and Vincent Christlein},
journal= {arXiv preprint arXiv:2401.11831},
year = {2024}
}
备注
DAS 2022