中文

DocDeshadower:面向文档阴影去除的频率感知Transformer

计算机视觉与模式识别 2024-07-31 v2

摘要

扫描文档中的阴影因其对视觉质量和可读性的负面影响,给文档分析与识别任务带来显著挑战。当前的阴影去除技术,包括传统方法和深度学习方法,在处理不同阴影强度以及保留文档细节方面存在局限。为解决这些问题,我们提出 DocDeshadower,一种基于拉普拉斯金字塔构建的新型多频率 Transformer 模型。该方法将阴影图像分解为多个频带,并采用两个关键模块:用于低频阴影去除的注意力聚合网络(Attention-Aggregation Network)和用于全局精化的门控多尺度融合 Transformer(Gated Multi-scale Fusion Transformer)。DocDeshadower 能在不同尺度上有效去除阴影,同时保留文档内容。大量实验表明,DocDeshadower 相比当前最优(SOTA)方法具有更优性能,凸显其在显著提升文档阴影去除技术方面的潜力。代码见 https://github.com/leiyingtie/DocDeshadower。

关键词

引用

@article{arxiv.2307.15318,
  title  = {DocDeshadower: Frequency-Aware Transformer for Document Shadow Removal},
  author = {Ziyang Zhou and Yingtie Lei and Xuhang Chen and Shenghong Luo and Wenjun Zhang and Chi-Man Pun and Zhen Wang},
  journal= {arXiv preprint arXiv:2307.15318},
  year   = {2024}
}

备注

Accepted by IEEE International Conference on Systems, Man, and Cybernetics 2024