GRAM:用于多页视觉问答的全局推理
计算与语言
2024-03-19 v2 计算机视觉与模式识别
摘要
基于 Transformer 的大型语言模型的日益普及带来了处理长序列的挑战。在文档视觉问答(DocVQA)中,领先的方法专注于单页设置,而文档可能跨越数百页。我们提出了 GRAM,这是一种无需计算密集型预训练即可将预训练的单页模型无缝扩展到多页设置的方法。为此,我们利用单页编码器进行局部页面级理解,并通过文档级专用层和可学习令牌对其进行增强,从而促进跨页面的信息流以实现全局推理。为了强制我们的模型利用新引入的文档令牌,我们提出了一种定制的偏置适应方法。为了在解码过程中进一步节省计算量,我们引入了一个可选的压缩阶段,使用我们的压缩 Transformer(C-Former)来减少编码序列长度,从而在质量和延迟之间实现权衡。广泛的实验展示了 GRAM 在多页 DocVQA 基准测试中的最先进性能,证明了我们方法的有效性。
引用
@article{arxiv.2401.03411,
title = {GRAM: Global Reasoning for Multi-Page VQA},
author = {Tsachi Blau and Sharon Fogel and Roi Ronen and Alona Golts and Roy Ganz and Elad Ben Avraham and Aviad Aberdam and Shahar Tsiper and Ron Litman},
journal= {arXiv preprint arXiv:2401.03411},
year = {2024}
}