基于多尺度特征提取的高效生成对抗网络用于彩色文档图像增强与二值化
计算机视觉与模式识别
2025-12-02 v2
摘要
因各种污染物的干扰,脏化彩色文档图像的文本识别结果往往令人不满意。为更高效地提取信息,文档图像增强与二值化常作为文档分析的前处理步骤。为每个颜色通道训练独立的生成对抗网络(GAN)可生成有效去除阴影和噪声的图像,从而实现高效文本信息提取。然而,为不同颜色通道采用多个GAN需要较长的训练和推理时间。为减少这些前处理步骤的训练和推理时间,我们提出一种基于多尺度特征提取的高效方法,采用小波变换和归一化处理文档图像后再输入GAN进行训练。实验结果表明,我们的方法在保持与最新方法相当性能的同时,显著降低了训练和推理时间。在最佳情况下,训练时间减少10%,推理时间减少26%,模型性能以73.79的平均得分指标为准。本工作的实现代码已公开于https://github.com/RuiyangJu/Efficient_Document_Image_Binarization。
引用
@article{arxiv.2407.04231,
title = {Efficient Generative Adversarial Networks for Color Document Image Enhancement and Binarization Using Multi-scale Feature Extraction},
author = {Rui-Yang Ju and KokSheik Wong and Jen-Shiun Chiang},
journal= {arXiv preprint arXiv:2407.04231},
year = {2025}
}
备注
Accepted to APSIPA ASC 2025