中文

基于增量元自训练的半监督关系抽取

计算与语言 2021-09-13 v2 机器学习

摘要

为减轻人工获取大规模标注的负担,半监督关系抽取方法旨在利用未标注数据,并结合有限样本进行学习。现有的自训练方法存在渐进漂移问题,即在训练过程中将未标注数据上的噪声伪标签纳入。为缓解伪标签中的噪声,我们提出一种称为 MetaSRE 的方法,其中关系标签生成网络通过对关系分类网络成功与失败尝试的(元)学习,作为附加元目标来生成伪标签的质量评估。为降低噪声伪标签的影响,MetaSRE 采用伪标签选择与利用机制,该机制评估未标注样本上的伪标签质量,并以自训练方式仅利用高质量伪标签来增量扩充标注样本,从而兼顾鲁棒性与准确性。在两个公开数据集上的实验结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2010.16410,
  title  = {Semi-supervised Relation Extraction via Incremental Meta Self-Training},
  author = {Xuming Hu and Chenwei Zhang and Fukun Ma and Chenyao Liu and Lijie Wen and Philip S. Yu},
  journal= {arXiv preprint arXiv:2010.16410},
  year   = {2021}
}

备注

In Findings of EMNLP 2021 as a long paper. Code and data available at https://github.com/THU-BPM/MetaSRE