中文

LongFin:面向长金融领域文档的多模态文档理解模型

计算与语言 2024-01-29 v1

摘要

文档 AI 是一个日益发展的研究领域,专注于从扫描和数字文档中理解和提取信息,以使日常业务运营更高效。为了训练能够解析和提取各种文档类型(如收据和扫描表格)信息的 AI 模型,已经引入了大量的下游任务和数据集。尽管取得了这些进展,现有的数据集和模型都未能解决工业环境中出现的关键挑战。现有数据集主要包含由单页组成的短文档,而现有模型则受限于有限的最大长度,通常设定为 512 个 token。因此,这些方法在金融服务中的实际应用受到严重阻碍,因为那里的文档可能跨越多个页面。为了克服这些挑战,我们引入了 LongFin,一个能够编码多达 4K 个 token 的多模态文档 AI 模型。我们还提出了 LongForms 数据集,这是一个全面的金融数据集,概括了金融文档中的若干工业挑战。通过广泛的评估,我们证明了 LongFin 模型在 LongForms 数据集上的有效性,其性能超越了现有的公共模型,同时在现有的单页基准测试上保持了可比的结果。

关键词

引用

@article{arxiv.2401.15050,
  title  = {LongFin: A Multimodal Document Understanding Model for Long Financial Domain Documents},
  author = {Ahmed Masry and Amir Hajian},
  journal= {arXiv preprint arXiv:2401.15050},
  year   = {2024}
}

备注

Accepted at AAAI 2024 Workshop on AI in Finance for Social Impact