PGA-SciRE:利用大语言模型进行数据增强以提升科学关系抽取
计算与语言
2024-06-03 v1
摘要
关系抽取旨在识别文本中提及的实体对之间的关系。大语言模型的进步对自然语言处理产生了巨大影响。在这项工作中,我们提出了一个名为PGA的文本数据增强框架,用于提升科学领域关系抽取模型的性能。该框架引入了两种数据增强方式:利用大语言模型通过改写原始训练集样本来获得具有相同句子含义但不同表示和形式的伪样本;以及指导大语言模型根据原始训练集样本的关系和实体生成隐式包含相应标签信息的句子。这两类伪样本分别与原始数据集一起参与关系抽取模型的训练。实验中的PGA框架提升了科学领域内三种主流关系抽取模型的F1分数。此外,使用大语言模型获取样本可以有效降低人工标注数据的成本。
引用
@article{arxiv.2405.20787,
title = {PGA-SciRE: Harnessing LLM on Data Augmentation for Enhancing Scientific Relation Extraction},
author = {Yang Zhou and Shimin Shan and Hongkui Wei and Zhehuan Zhao and Wenshuo Feng},
journal= {arXiv preprint arXiv:2405.20787},
year = {2024}
}