DocMamba:基于状态空间模型的高效文档预训练框架
计算与语言
2025-02-11 v2 人工智能
摘要
近年来,视觉丰富文档理解受到广泛关注。基于Transformer的预训练模型已成为该领域的主流方法,取得显著性能提升。然而,自注意力机制的二次计算复杂度限制了其效率和处理长文档的能力。本文提出DocMamba,一种基于状态空间模型的新型框架,旨在将计算复杂度降低为线性,同时保持全局建模能力。为进一步提升其在文档处理中的效果,我们引入了分段优先双向扫描(Segment-First Bidirectional Scan, SFBS)以捕获连续语义信息。实验结果表明,DocMamba在FUNSD、CORD和SORIE等下游数据集上实现了新的状态-of-the-art性能,同时显著提升速度并降低内存使用。值得注意的是,HRDoc上的实验确认了DocMamba在长度外推方面的潜力。
引用
@article{arxiv.2409.11887,
title = {DocMamba: Efficient Document Pre-training with State Space Model},
author = {Pengfei Hu and Zhenrong Zhang and Jiefeng Ma and Shuhang Liu and Jun Du and Jianshu Zhang},
journal= {arXiv preprint arXiv:2409.11887},
year = {2025}
}