DocIQ:面向文档图像质量评估的数据集与特征融合网络
计算机视觉与模式识别
2025-09-23 v1 机器学习
图像与视频处理
摘要
文档图像质量评估(DIQA)是包括光学字符识别(OCR)、文档修复以及文档图像处理系统评估在内的众多应用中的重要组成部分。本文引入了主观DIQA数据集DIQA-5000。DIQA-5000数据集包含5000张文档图像,通过对500张具有多种畸变的真实世界图像应用多种文档增强技术生成。每张增强图像都由15名受试者在三个评估维度上进行评分:整体质量、锐度和颜色保真度。此外,我们提出了一种专门的无参考DIQA模型,利用文档布局特征以降低分辨率下的质量感知,以降低计算成本。鉴于图像质量受低层次和高层次视觉特征的影响,我们设计了特征融合模块,从文档图像中提取并集成多层次特征。为生成多维评分,我们的模型采用独立的质量头部为每个维度预测评分分布,使其能够学习文档图像质量的不同方面。实验结果表明,我们的方法在DIQA-5000以及额外关注OCR准确率的数据集上均优于当前最先进的通用IQA模型。
引用
@article{arxiv.2509.17012,
title = {DocIQ: A Benchmark Dataset and Feature Fusion Network for Document Image Quality Assessment},
author = {Zhichao Ma and Fan Huang and Lu Zhao and Fengjun Guo and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2509.17012},
year = {2025}
}