中文

DocRes:面向统一文档图像修复任务的通用模型

计算机视觉与模式识别 2024-05-08 v1

摘要

文档图像修复是文档 AI 系统的关键环节,因为图像质量显著影响整体性能。现有方法独立处理不同的修复任务,导致系统复杂且无法发挥多任务学习的潜在协同效应。为此,我们提出 DocRes,一个统一五类文档图像修复任务的通用模型,包括倾斜校正、阴影去除、外观增强、去模糊和二值化。为使 DocRes 能完成各种修复任务,我们提出一种新颖的视觉提示方法,称为动态任务特定提示(DTSPrompt)。不同任务的 DTSPrompt 由各自的先验特征构成,这些特征是从输入图像中提取的附加特征。除了作为任务特定执行的线索外,DTSPrompt 还能作为补充信息来提升模型性能。此外,DTSPrompt 比先前的视觉提示方法更灵活,能够无缝应用于分辨率高且可变的输入。实验结果表明,DocRes 在性能上与现有最先进的任务特定模型相当或更优。这凸显了 DocRes 在更广泛的文档图像修复任务中的潜力。源码已公开于 https://github.com/ZZZHANG-jx/DocRes

关键词

引用

@article{arxiv.2405.04408,
  title  = {DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks},
  author = {Jiaxin Zhang and Dezhi Peng and Chongyu Liu and Peirong Zhang and Lianwen Jin},
  journal= {arXiv preprint arXiv:2405.04408},
  year   = {2024}
}

备注

Accepted by CVPR 2024