中文

迈向类人机器理解:视觉丰富文档中的少样本关系学习

计算机视觉与模式识别 2024-03-26 v1 人工智能 信息检索

摘要

键值关系在视觉丰富文档(VRD)中普遍存在,通常以不同的空间区域呈现,并伴有特定的颜色和字体样式。这些非文本线索是重要的指示符,极大地增强了人类对此类关系三元组的理解和获取。然而,当前的文档AI方法往往未能考虑与视觉和空间特征相关的这一有价值的先验信息,导致性能欠佳,尤其是在处理有限样本时。为了解决这一局限性,我们的研究聚焦于少样本关系学习,专门针对VRD中键值关系三元组的提取。由于缺乏适合此任务的数据集,我们基于现有的监督基准数据集引入了两个新的少样本基准。此外,我们提出了一种变分方法,融合了关系二维空间先验和原型修正技术。该方法旨在生成更关注空间上下文和未见关系的关系表示,类似于人类感知。实验结果表明,我们提出的方法能够超越现有方法,证明了其有效性。这项研究也为实际应用开辟了新的可能性。

关键词

引用

@article{arxiv.2403.15765,
  title  = {Towards Human-Like Machine Comprehension: Few-Shot Relational Learning in Visually-Rich Documents},
  author = {Hao Wang and Tang Li and Chenhui Chu and Nengjun Zhu and Rui Wang and Pinpin Zhu},
  journal= {arXiv preprint arXiv:2403.15765},
  year   = {2024}
}

备注

13 pages, 7 figures, accepted by LERC-COLING2024