中文

DocMamba:基于状态空间模型的高效文档预训练框架

计算与语言 2025-02-11 v2 人工智能

摘要

近年来,视觉丰富文档理解受到广泛关注。基于Transformer的预训练模型已成为该领域的主流方法,取得显著性能提升。然而,自注意力机制的二次计算复杂度限制了其效率和处理长文档的能力。本文提出DocMamba,一种基于状态空间模型的新型框架,旨在将计算复杂度降低为线性,同时保持全局建模能力。为进一步提升其在文档处理中的效果,我们引入了分段优先双向扫描(Segment-First Bidirectional Scan, SFBS)以捕获连续语义信息。实验结果表明,DocMamba在FUNSD、CORD和SORIE等下游数据集上实现了新的状态-of-the-art性能,同时显著提升速度并降低内存使用。值得注意的是,HRDoc上的实验确认了DocMamba在长度外推方面的潜力。

关键词

引用

@article{arxiv.2409.11887,
  title  = {DocMamba: Efficient Document Pre-training with State Space Model},
  author = {Pengfei Hu and Zhenrong Zhang and Jiefeng Ma and Shuhang Liu and Jun Du and Jianshu Zhang},
  journal= {arXiv preprint arXiv:2409.11887},
  year   = {2025}
}