中文

面向零样本文档级关系三元组抽取的 LLM 一致性引导知识检索与去噪

计算与语言 2024-01-25 v1

摘要

文档级关系三元组抽取 (DocRTE) 是信息系统中的一项基础任务,旨在从文档中同时提取具有语义关系的实体。现有方法严重依赖大量完全标注的数据。然而,为新出现的关系收集和标注数据既耗时又费力。近期先进的大型语言模型 (LLM),如 ChatGPT 和 LLaMA,展现出令人印象深刻的生成长文本能力,这启发我们探索一种替代方法,以获取具有新关系的自动标注文档。在本文中,我们提出了一个零样本文档级关系三元组抽取 (ZeroDocRTE) 框架,该框架通过从 LLM 中检索和去噪知识来生成标注数据,称为 GenRDK。具体来说,我们提出了一种检索链提示,以引导 ChatGPT 逐步生成长文本标注数据。为了提高合成数据的质量,我们提出了一种基于跨文档知识一致性的去噪策略。利用我们经过去噪的合成数据,我们进一步微调 LLaMA2-13B-Chat 模型,用于提取文档级关系三元组。我们在两个公共数据集上进行了零样本文档级关系和三元组抽取的实验。实验结果表明,我们的 GenRDK 框架优于强基线。

关键词

引用

@article{arxiv.2401.13598,
  title  = {Consistency Guided Knowledge Retrieval and Denoising in LLMs for Zero-shot Document-level Relation Triplet Extraction},
  author = {Qi Sun and Kun Huang and Xiaocui Yang and Rong Tong and Kun Zhang and Soujanya Poria},
  journal= {arXiv preprint arXiv:2401.13598},
  year   = {2024}
}

备注

Accepted by WWW 2024