GVdoc:基于图的视觉文档分类
计算机视觉与模式识别
2023-05-30 v1 计算与语言
机器学习
摘要
模型在真实世界部署中的鲁棒性取决于其在未见过数据上的表现以及区分域内与域外样本的能力。视觉文档分类器在分布内测试集上已展现出令人印象深刻的性能。然而,它们往往难以正确分类和区分分布外样本。基于图像的分类器缺乏文本组件,而基于多模态Transformer的模型由于视觉文档布局多样,面临词元序列化问题。它们在推理时也需要大量计算力,使其在许多真实世界应用中不切实际。我们提出GVdoc,一种基于图的文档分类模型,可应对这两类挑战。我们的方法基于文档布局生成文档图,然后训练图神经网络学习节点与图嵌入。通过实验,我们表明即便参数更少,我们的模型在分布外数据上优于最先进(SOTA)模型,同时在分布内测试集上保持相当性能。
引用
@article{arxiv.2305.17219,
title = {GVdoc: Graph-based Visual Document Classification},
author = {Fnu Mohbat and Mohammed J. Zaki and Catherine Finegan-Dollak and Ashish Verma},
journal= {arXiv preprint arXiv:2305.17219},
year = {2023}
}