中文

GDA:面向关系抽取任务的生成式数据增强技术

计算与语言 2023-06-16 v2

摘要

关系抽取(RE)任务在从句子中所提及的两个实体间抽取关系时,若训练期间有充足标注可用,则展现出良好的性能。此类标注在实践中获取费力。现有工作采用数据增强技术,在有限标注之外生成伪标注句子。这些技术在使用基于规则的增强时既不能保持原句的语义一致性,在使用 seq2seq 模型表达关系时也不能保持句子的句法结构,导致增强多样性不足。本工作中,我们提出一种专用于关系文本的增强技术,名为 GDA,其使用两个互补模块来同时保持语义一致性与句法结构。我们采用生成式表述并设计多任务方案以实现协同。此外,GDA 采用实体提示作为生成模型的先验知识以增强多样化句子。在低资源设定下三个数据集上的实验结果表明,与不采用增强技术相比,GDA 可带来 2.0% 的 F1 提升。源代码与数据已公开。

关键词

引用

@article{arxiv.2305.16663,
  title  = {GDA: Generative Data Augmentation Techniques for Relation Extraction Tasks},
  author = {Xuming Hu and Aiwei Liu and Zeqi Tan and Xin Zhang and Chenwei Zhang and Irwin King and Philip S. Yu},
  journal= {arXiv preprint arXiv:2305.16663},
  year   = {2023}
}

备注

Accepted to ACL 2023 (Findings), Long Paper, 12 pages