中文

Fast-StrucTexT:一种基于模态引导动态令牌合并的高效沙漏Transformer用于文档理解

计算机视觉与模式识别 2023-05-22 v1 计算与语言

摘要

Transformer 在文档理解中取得了令人瞩目的性能,因其高效性,但仍受限于随序列长度呈二次方增长的计算复杂度。通用的高效 Transformer 难以直接适配于文档建模,它们无法处理文档中词、行、段落等不同粒度层级的布局表示,且似乎难以在效率与性能间取得良好权衡。为解决这些问题,我们提出 Fast-StrucTexT,一种基于 StrucTexT 算法、采用沙漏 Transformer 架构的高效多模态框架,用于视觉文档理解。具体而言,我们设计了一个模态引导的动态令牌合并模块,使模型学习多粒度表示并剪枝冗余令牌。此外,我们提出一种称为对称交叉注意力(SCA)的多模态交互模块,以考虑多模态融合并高效引导令牌合并。SCA 允许以一种模态输入作为查询,与另一模态在双阶段中计算交叉注意力。在 FUNSD、SROIE 和 CORD 数据集上的大量实验表明,我们的模型取得了最先进的性能,且推理时间比最先进方法快近 1.9 倍。

关键词

引用

@article{arxiv.2305.11392,
  title  = {Fast-StrucTexT: An Efficient Hourglass Transformer with Modality-guided Dynamic Token Merge for Document Understanding},
  author = {Mingliang Zhai and Yulin Li and Xiameng Qin and Chen Yi and Qunyi Xie and Chengquan Zhang and Kun Yao and Yuwei Wu and Yunde Jia},
  journal= {arXiv preprint arXiv:2305.11392},
  year   = {2023}
}

备注

IJCAI 2023