中文

面向文档图像少样本实体识别:一种对图像变换鲁棒的图神经网络方法

计算与语言 2024-02-26 v2 计算机视觉与模式识别

摘要

近期将布局信息(通常为边界框坐标)融入预训练语言模型的方法,在文档图像实体识别上取得了显著性能。使用坐标可以轻松建模每个词元的绝对位置,但它们可能对文档图像中的变换(如平移、旋转或缩放)较为敏感,尤其在少样本设定下训练数据有限时。本文中,我们提出进一步引入词元间的拓扑邻接关系,以强调其相对位置信息。具体而言,我们将文档中的词元视为节点,并基于k近邻边界框的拓扑启发式方法构建边。此类邻接图对包含平移、旋转和缩放的仿射变换具有不变性。我们通过在该语言模型嵌入之上添加图神经网络层将这些图融入预训练语言模型,从而提出一种新颖模型LAGER。在两个基准数据集上的大量实验表明,LAGER在不同少样本设定下显著优于强基线,并展现出更好的抗变换鲁棒性。

关键词

引用

@article{arxiv.2305.14828,
  title  = {Towards Few-shot Entity Recognition in Document Images: A Graph Neural Network Approach Robust to Image Manipulation},
  author = {Prashant Krishnan and Zilong Wang and Yangkun Wang and Jingbo Shang},
  journal= {arXiv preprint arXiv:2305.14828},
  year   = {2024}
}