GL-PGENet:用于鲁棒文档图像增强的参数化生成框架
计算机视觉与模式识别
2025-10-10 v2 人工智能
摘要
文档图像增强(DIE)是文档 AI 系统中的关键组件,其性能在很大程度上决定了下游任务的有效性。为解决现有方法局限于单一退化恢复或灰度图像处理的局限性,我们提出了全局与局部参数化生成增强网络(Global with Local Parametric Generation Enhancement Network, GL-PGENet),这是一种专为多重退化彩色文档图像设计的新型架构,确保在真实场景中的效率与鲁棒性。我们的解决方案包含三项关键创新:首先,一种分层增强框架,将全局外观校正与局部细化相结合,实现由粗到细的质量提升。其次,具有参数化生成机制的双分支局部细化网络,取代了传统的直接预测,通过学习到的中间参数化表示而非像素级映射来生成增强输出。该方法增强了局部一致性,同时提升了模型泛化能力。最后,结合密集块的改进型 NestUNet 架构,有效融合低级像素特征与高级语义特征,专门针对文档图像特性进行了适配。此外,为提升泛化性能,我们采用两阶段训练策略:在包含 50 万个以上样本的合成数据集上进行大规模预训练,随后进行特定任务的微调。大量实验证明了 GL-PGENet 的优越性,在 DocUNet 和 RealDAE 上分别取得了 0.7721 和 0.9480 的 SOTA SSIM 分数。该模型还展现出显著的跨域适应性,并在不降低性能的情况下保持高分辨率图像的计算效率,证实了其在真实场景中的实用价值。
引用
@article{arxiv.2505.22021,
title = {GL-PGENet: A Parameterized Generation Framework for Robust Document Image Enhancement},
author = {Zhihong Tang},
journal= {arXiv preprint arXiv:2505.22021},
year = {2025}
}
备注
12 pages, 7 figures