面向不完全标注训练数据的类自适应自训练关系抽取方法
计算与语言
2023-06-19 v1
摘要
关系抽取(RE)旨在从句子和文档中抽取关系。现有的关系抽取模型通常依赖于有监督机器学习。然而,近期研究表明许多 RE 数据集标注不完全,这被称为假阴性问题,即有效关系被错误标注为“无关系”。用此类数据训练的模型在推理阶段不可避免地犯类似错误。自训练已被证明能有效缓解假阴性问题。然而,传统自训练易受确认偏差影响,且在少数类上表现不佳。为克服该局限,我们提出了一种新颖的类自适应重采样自训练框架。具体而言,我们依据精确率与召回率分数对每个类的伪标签进行重采样。我们的重采样策略偏好高精确率、低召回率类的伪标签,从而在不显著牺牲精确率的情况下提升整体召回率。我们在文档级与生物医学关系抽取数据集上开展实验,结果表明在不完全标注训练数据时,我们提出的自训练框架在 Re-DocRED 与 ChemDisgene 数据集上持续优于现有竞争方法。我们的代码发布于 https://github.com/DAMO-NLP-SG/CAST。
引用
@article{arxiv.2306.09697,
title = {Class-Adaptive Self-Training for Relation Extraction with Incompletely Annotated Training Data},
author = {Qingyu Tan and Lu Xu and Lidong Bing and Hwee Tou Ng},
journal= {arXiv preprint arXiv:2306.09697},
year = {2023}
}
备注
ACL 2023 Findings