STAD:面向低资源关系抽取的使用模糊数据的自训练方法
计算与语言
2022-09-08 v2
摘要
我们提出一种简单而有效的自训练方法 STAD,用于低资源关系抽取。该方法首先根据教师模型预测的概率将自动标注实例分为两组:置信实例与不确定实例。与多数以往主要仅利用置信实例进行自训练的研究不同,我们利用了不确定实例。为此,我们提出一种从不确定实例中识别模糊但有用以至实例的方法,随后为每个模糊实例将关系划分为候选标签集与负标签集。接下来,我们对模糊实例的负标签集提出集合负训练方法,对置信实例提出正训练方法。最后,提出联合训练方法在所有数据上构建最终的关系抽取系统。在 SemEval2010 Task-8 与 Re-TACRED 两个广泛使用的数据集上的低资源设置实验表明,与若干有竞争力的自训练系统相比,该新自训练方法确实取得了显著且一致的提升。代码已公开于 https://github.com/jjyunlp/STAD
引用
@article{arxiv.2209.01431,
title = {STAD: Self-Training with Ambiguous Data for Low-Resource Relation Extraction},
author = {Junjie Yu and Xing Wang and Jiangjiang Zhao and Chunjie Yang and Wenliang Chen},
journal= {arXiv preprint arXiv:2209.01431},
year = {2022}
}
备注
Accepted by COLING'22