中文

合成训练数据中误导性陈述对关系抽取的影响

计算与语言 2024-10-14 v1 人工智能 信息检索

摘要

关系抽取是构建知识图谱的关键技术,大型高质量数据集是训练、微调和评估模型的基础。生成式数据扩充(GDA)是一种常见的数据扩充方法,但该方法常会引入误导性陈述,如虚构事实,其对关系抽取的影响尚未充分探讨。本文 examination了误导性陈述对文档和句子层面关系抽取性能的影响。我们的实证研究表明,误导性陈述显著损害模型从文本中抽取关系的能力,召回率下降范围为19.1%至39.2%。我们识别到,相关的误导性陈述会损害模型性能,而与其无关的误导性陈述影响较小。此外,我们发展了误导性陈述检测方法以提高数据质量和模型性能。我们的这些方法成功地将文本分类为"误导性"或"干净",在F1分数上分别达到83.8%和92.2%。这些方法不仅有助于移除误导性陈述,也有助于估计数据集中误导性陈述的流行率,这对于选择高质量数据至关重要。总体而言,我们的工作确认了相关误导性陈述对关系抽取模型有效性的深远影响。

关键词

引用

@article{arxiv.2410.08393,
  title  = {The Effects of Hallucinations in Synthetic Training Data for Relation Extraction},
  author = {Steven Rogulsky and Nicholas Popovic and Michael Färber},
  journal= {arXiv preprint arXiv:2410.08393},
  year   = {2024}
}

备注

Accepted at KBC-LM@ISWC'24