MFE-GAN:基于多尺度特征提取的文档图像增强与二值化高效 GAN 框架
计算机视觉与模式识别
2025-12-17 v1
摘要
文档图像增强和二值化通常在文档分析和识别任务之前进行,以提高光学字符识别(OCR)系统的效率和准确性。这是一个因为直接识别在退化文档中(特别是彩色图像中)的文本往往导致不令人满意的识别效果。为了解决这些问题,现有方法为不同的颜色通道训练独立的生成对抗网络(GAN),以去除阴影和噪声,从而促进文本信息的高效提取。然而,部署多个 GAN 会导致训练和推理时间较长。为了减少文档图像增强和二值化模型的训练和推理时间,我们提出了 MFE-GAN,一种具有多尺度特征提取(MFE)的高效 GAN 框架,该框架在将文档图像输入 GAN 进行训练前采用 Haar 小波变换(HWT)和归一化处理。此外,我们提出了新的生成器、判别器和损失函数以提高模型性能,并进行消融研究以证明其有效性。在 Benchmark、Nabuco 和 CMATERdb 数据集上的实验结果表明,所提出的 MFE-GAN 在保持与最先进(SOTA)方法相当的性能的同时,显著减少了总体训练和推理时间。该工作的实现地址为 https://ruiyangju.github.io/MFE-GAN。
引用
@article{arxiv.2512.14114,
title = {MFE-GAN: Efficient GAN-based Framework for Document Image Enhancement and Binarization with Multi-scale Feature Extraction},
author = {Rui-Yang Ju and KokSheik Wong and Yanlin Jin and Jen-Shiun Chiang},
journal= {arXiv preprint arXiv:2512.14114},
year = {2025}
}
备注
Extended Journal Version of APSIPA ASC 2025