中文

面向文档信息抽取的样本导向式自注意学习 (SAIL)

计算与语言 2024-12-24 v1 人工智能

摘要

文档信息抽取 (Document Information Extraction, DIE) 旨在从视觉丰富文档 (Visually Rich Documents, VRDs) 中抽取结构化信息。以往的全参数训练方法表现出色,但可能在处理未见数据时存在泛化困难的问题。相比之下,训练-free 方法利用像大语言模型 (Large Language Models, LLMs) 这样的强大预训练模型,仅需少量示例即可应对各种下游任务。然而,针对 DIE 的训练-free 方法面临两个主要挑战:(1) 理解 VRDs 中布局与文本元素之间的复杂关系;(2) 为预训练模型提供准确的指导。为此,我们提出了一种名为样本导向式自注意学习 (Sample-centric In-context Learning, SAIL) 的方法,用于 DIE。SAIL 引入了细粒度的实体级文本相似性,以促进 LLMs 对文本的深入分析,并将布局相似性纳入,以增强对 VRDs 中布局的分析。此外,SAIL 构构了一个统一的自注意学习 (In-Context Learning, ICL) 提示模板,用于各种样本导向的示例,使能够为每个样本提供精确的指导。在 FUNSD、CORD 和 SROIE 基准测试上进行了大量实验,采用 various base models (如 LLMs),表明我们的方法在训练-free 的基线方法上取得了更好的性能,甚至接近全参数训练的方法。结果表明,我们方法的优越性和泛化性。

关键词

引用

@article{arxiv.2412.17092,
  title  = {SAIL: Sample-Centric In-Context Learning for Document Information Extraction},
  author = {Jinyu Zhang and Zhiyuan You and Jize Wang and Xinyi Le},
  journal= {arXiv preprint arXiv:2412.17092},
  year   = {2024}
}

备注

accepted by AAAI 2025