基于完全合成演示的 DocIE@XLLM25:信息抽取中的情境学习
统计力学
2025-08-29 v2
摘要
大规模高质量标注语料在文档级实体和关系抽取的零样学习或少样学习情境中仍显稀缺。本文提出了一种完全自动的、基于大语言模型的合成数据生成和情境学习管道,用于文档级实体和关系抽取。与现有方法依赖人工标注演示或直接零样学习推理不同,我们的方法将合成数据生成与检索式情境学习相结合,使用经过优化的语言模型进行推理。这使我们能够在不进行人工标注的情况下构建高质量的演示数据库,并在推理时动态检索相关示例。基于我们的方法,我们生成了超过5000个维基百科摘要,包含约59000个实体和30000个关系三元组。最后,我们在DocIE共享任务上评估了情境学习性能,在零样学习设置下从长文档中抽取实体和关系。我们发现,即使在最先进的大型语言模型中,文档级的情境联合实体和关系抽取仍是一个具有挑战性的任务。
引用
@article{arxiv.2507.05998,
title = {Finite-size scaling of percolation on scale-free networks},
author = {Xuewei Zhao and Liwenying Yang and Dan Peng and Run-Ran Liu and Ming Li},
journal= {arXiv preprint arXiv:2507.05998},
year = {2025}
}
备注
10 pages, 9 figures