中文

FormNetV2:面向表单文档信息抽取的多模态图对比学习

计算与语言 2023-06-14 v2 计算机视觉与模式识别 机器学习

摘要

近年来自监督预训练技术的出现导致了表单文档理解中多模态学习的广泛使用。然而,现有将掩码语言建模扩展到其他模态的方法需要谨慎的多任务调优、复杂的重建目标设计或额外的预训练数据。在 FormNetV2 中,我们引入了一种集中式多模态图对比学习策略,以在一个损失中统一所有模态的自监督预训练。图对比目标最大化多模态表示之间的一致性,为所有模态提供了自然的相互作用而无需特殊定制。此外,我们在连接由图边相连的一对令牌的边界框内提取图像特征,在不加载复杂且单独预训练的的图像嵌入器的情况下捕获更有针对性的视觉线索。FormNetV2 在 FUNSD、CORD、SROIE 和 Payment 基准上以更紧凑的模型规模建立了新的最先进性能。

关键词

引用

@article{arxiv.2305.02549,
  title  = {FormNetV2: Multimodal Graph Contrastive Learning for Form Document Information Extraction},
  author = {Chen-Yu Lee and Chun-Liang Li and Hao Zhang and Timothy Dozat and Vincent Perot and Guolong Su and Xiang Zhang and Kihyuk Sohn and Nikolai Glushnev and Renshen Wang and Joshua Ainslie and Shangbang Long and Siyang Qin and Yasuhisa Fujii and Nan Hua and Tomas Pfister},
  journal= {arXiv preprint arXiv:2305.02549},
  year   = {2023}
}

备注

Accepted to ACL 2023