中文

基于双判别器生成对抗网络的 JPEG 压缩域文档图像二值化

计算机视觉与模式识别 2022-09-14 v1 人工智能 机器学习

摘要

图像二值化技术正被广泛用于增强含噪声和/或退化的图像,以服务于不同的文档图像分析(DIA)应用,如词 spotting、文档检索和 OCR。现有多数技术侧重于将像素图像输入卷积神经网络来完成文档二值化,当处理需要在不完全解压情况下处理的压缩图像时,这可能无法产生有效结果。因此,在本研究论文中,提出利用双判别器生成对抗网络(DD-GANs)直接使用文档图像的 JPEG 压缩流进行文档图像二值化的思路。此处两个判别器网络——全局与局部——工作于不同图像比例,并使用 focal loss 作为生成器损失。所提模型已使用不同版本的 DIBCO 数据集进行了充分测试,这些数据集具有孔洞、墨迹擦除或污损、灰尘和错位纤维等挑战。该模型被证明具有高度鲁棒性,在时间和空间复杂度上均高效,并在 JPEG 压缩域取得了 SOTA 性能。

关键词

引用

@article{arxiv.2209.05921,
  title  = {Document Image Binarization in JPEG Compressed Domain using Dual Discriminator Generative Adversarial Networks},
  author = {Bulla Rajesh and Manav Kamlesh Agrawal and Milan Bhuva and Kisalaya Kishore and Mohammed Javed},
  journal= {arXiv preprint arXiv:2209.05921},
  year   = {2022}
}

备注

Accepted in IAPR endorsed first International Conference on Computer Vision and Machine Intelligence (CVMI2022), held at IIIT Allahabad