利用大语言模型从混合长文档中提取信息:一个框架和数据集
计算与语言
2025-01-03 v2 人工智能
摘要
大语言模型在文本理解和表格推理任务中表现卓越。然而,其在理解和分析包含文本和表格数据的混合文本方面的能力尚未探索。混合文本常以混合长文档 (HLD) 形式出现,这些文档远超大语言模型的 token 限制。因此,我们应用一种自动信息提取框架 (AIE) 来使大语言模型能够处理 HLD 并开展对信息提取 HLD 四个重要方面的实验。基于这些发现:1) 选择和总结 HLD 有用部分的有效方法;2) 一种简单的数据表序列化方式足以让大语言模型理解数据表;3) 朴素的 AIE 在许多复杂场景中具有适应性;4) 增强大语言模型在 HLD 上的有效提示工程。为解决 HLD 数据稀缺问题并支持未来工作,我们还提出了 Financial Reports Numerical Extraction (FINE) 数据集。该数据集和代码已公开于附件中。
引用
@article{arxiv.2412.20072,
title = {Extract Information from Hybrid Long Documents Leveraging LLMs: A Framework and Dataset},
author = {Chongjian Yue and Xinrun Xu and Xiaojun Ma and Lun Du and Zhiming Ding and Shi Han and Dongmei Zhang and Qi Zhang},
journal= {arXiv preprint arXiv:2412.20072},
year = {2025}
}
备注
ICASSP 2025