中文

利用大语言模型进行文档级事件论据数据增强以应对挑战性角色类型

计算与语言 2024-06-14 v2 机器学习

摘要

事件论据抽取 (EAE) 是一个极其困难的信息抽取问题,在少样本跨域 (FSCD) 设置中存在显著局限性。解决 FSCD 建模的常见方案是数据增强。不幸的是,现有的增强方法并不适用于各种现实世界的 EAE 场景,包括:(i) 需要对长文档(10+ 句子)建模的需求;(ii) 需要对零样本和少样本角色(即训练表示极少或没有的事件角色)建模的需求。在本工作中,我们引入了两种新颖的由大语言模型 (LLM) 驱动的数据增强框架,用于在零内部领域训练数据的情况下合成抽取式文档级 EAE 样本。我们表现最佳的方法在零样本角色类型的抽取上使 F1 分数提高了 16 个百分点。为了更好地促进跨域 EAE 分析,我们还引入了一种新指标——角色深度 F1 (RDF1),该指标利用统计深度来识别目标领域中相对于源领域观察到的角色而言属于语义异常值的角色。我们的实验表明,与基线方法相比,基于 LLM 的增强可将 RDF1 性能提高多达 11 个 F1 点。

关键词

引用

@article{arxiv.2403.03304,
  title  = {Large Language Models for Document-Level Event-Argument Data Augmentation for Challenging Role Types},
  author = {Joseph Gatto and Parker Seegmiller and Omar Sharif and Sarah M. Preum},
  journal= {arXiv preprint arXiv:2403.03304},
  year   = {2024}
}

备注

Paper in submission (8 pages)