“{templates}有什么价值?”——重新思考面向 LLM 的文档信息提取数据集
计算与语言
2024-12-02 v1
摘要
大型语言模型(LLM)用于视觉丰富文档理解(VRDU)的兴起,催生了对基于提示-响应的文档数据集的需求。由于从头创建新数据集工作量巨大,现有文献通常通过简单模板从可用资源生成提示-响应数据集。就关键信息提取(KIE)而言,这是最常见的VRDU任务,过去的工作通常采用“What is the value for the {key}?”的模板。然而,鉴于在实际场景中遇到的问题种类繁多,简单且统一的模板对于创建稳健的模型(在研究和工业上下文中)已不足够。本文提出K2Q,一套从KIE转换为提示-响应格式的五个数据集,采用多种定制化模板。K2Q中的问题可以涵盖多个实体且可为抽取式或布尔式。我们对比评估了七个基线生成模型在K2Q上的零样本提示性能。我们进一步比较了其中三款模型在K2Q上的训练与在更简单模板上的训练,以动机化我们工作的必要性。我们发现,创建多样且复杂的KIE问题可提升VRDU模型的性能和鲁棒性。我们希望本工作能鼓励未来研究关注生成模型训练的数据质量。
引用
@article{arxiv.2410.15484,
title = {"What is the value of {templates}?" Rethinking Document Information Extraction Datasets for LLMs},
author = {Ran Zmigrod and Pranav Shetty and Mathieu Sibue and Zhiqiang Ma and Armineh Nourbakhsh and Xiaomo Liu and Manuela Veloso},
journal= {arXiv preprint arXiv:2410.15484},
year = {2024}
}
备注
Accepted to EMNLP Findings 2024