用于文档理解的长程 Transformer 架构
计算与语言
2023-09-12 v1
摘要
自发布以来,Transformer 已革新了从自然语言理解到计算机视觉的诸多领域。文档理解(DU)也未落后,基于 Transformer 的首批 DU 模型出现于 2019 年末。然而,自注意力操作的计算复杂度将其能力限制于短序列。本文探讨将基于 Transformer 的模型应用于长多页文档的多种策略。我们引入了两种新的多模态(文本+版式)长程 DU 模型,其基于面向长序列的 Transformer 高效实现。长程模型可一次性有效处理整篇文档,且受文档长度影响较小。我们将其与 LayoutLM(一种为 DU 调整并基于数百万文档预训练的经典 Transformer)进行比较。我们进一步提出 2D 相对注意力偏置,以在不损害模型效率的前提下引导自注意力关注相关词元。我们观察到在多页商业文档的信息检索上有所提升,而在较小序列上性能代价较小。相对 2D 注意力在密集文本上对常规与长程模型均证明有效。
引用
@article{arxiv.2309.05503,
title = {Long-Range Transformer Architectures for Document Understanding},
author = {Thibault Douzon and Stefan Duffner and Christophe Garcia and Jérémy Espinas},
journal= {arXiv preprint arXiv:2309.05503},
year = {2023}
}
备注
Conference: ICDAR 2023 Workshops on Document Analysis and Recognition