MATrIX——面向信息提取的模态感知Transformer
计算机视觉与模式识别
2022-05-18 v1
摘要
我们提出MATrIX——一种用于视觉文档理解(VDU)领域信息提取的模态感知Transformer。VDU涵盖从表单、发票、收据、表格、图表、演示文稿或广告等视觉丰富文档中提取信息。在这些文档中,文本语义与视觉信息相互补充,以提供对文档的全局理解。MATrIX通过专门设计的、要求使用多模态信息(空间、视觉或文本)的任务,以无监督方式进行预训练。我们将空间和文本模态同时考虑在单一token集合中。为使注意力机制更灵活,我们在注意力机制中使用可学习的模态感知相对偏置,以调节不同模态token之间的注意力。我们在3个不同数据集上评估MATrIX,每个数据集均有强基线模型。
引用
@article{arxiv.2205.08094,
title = {MATrIX -- Modality-Aware Transformer for Information eXtraction},
author = {Thomas Delteil and Edouard Belval and Lei Chen and Luis Goncalves and Vijay Mahadevan},
journal= {arXiv preprint arXiv:2205.08094},
year = {2022}
}