中文

基于 Vision Mamba 的自适应多尺度文档二值化

计算机视觉与模式识别 2024-10-31 v1

摘要

增强和保持文档图像(尤其是历史文档)的可读性,对于有效的文档图像分析至关重要。针对此任务已有众多模型被提出,包括基于卷积的、基于Transformer的以及混合卷积-Transformer架构。尽管混合模型弥补了纯卷积或纯Transformer方法的局限性,但它们往往遭受二次时间复杂度等问题。在本工作中,我们提出了一种基于Mamba的文档二值化架构,通过线性扩展和优化内存使用来高效处理长序列。此外,我们通过引入高斯差分(DoG)特征对跳跃连接进行了新颖的改进,灵感来源于常规信号处理技术。这些多尺度高频特征使模型能够生成高质量、细节丰富的输出。

关键词

引用

@article{arxiv.2410.22811,
  title  = {Adaptive Multi Scale Document Binarisation Using Vision Mamba},
  author = {Mohd. Azfar and Siddhant Bharadwaj and Ashwin Sasikumar},
  journal= {arXiv preprint arXiv:2410.22811},
  year   = {2024}
}