利用标签语言化与蕴含实现有效的零样本与少样本关系抽取
计算与语言
2021-09-09 v1
摘要
关系抽取系统需要大量标注样本,而标注成本高昂。在这项工作中,我们将关系抽取重新形式化为一个蕴含任务,使用简单、手工制作的关系语言化表述,每个关系耗时不到 15 分钟。该系统依赖于一个预训练的文本蕴含引擎,该引擎可直接运行(无训练样本,零样本)或在标注样本上进一步微调(少样本或完全训练)。在 TACRED 数据集上的实验中,我们达到了 63% 的零样本 F1 值,每个关系使用 16 个样本时达到 69%(比同等条件下的最佳监督系统高出 17 个百分点),仅比最先进水平(使用了 20 倍的训练数据)低 4 个百分点。我们还表明,使用更大的蕴含模型可以显著提高性能,零样本下最高可提升 12 个百分点,从而在完全训练时报告了 TACRED 上迄今最好的结果。分析表明,我们的少样本系统在区分关系时特别有效,并且低数据量情况下的性能差异主要源于对“无关系”情况的识别。
引用
@article{arxiv.2109.03659,
title = {Label Verbalization and Entailment for Effective Zero- and Few-Shot Relation Extraction},
author = {Oscar Sainz and Oier Lopez de Lacalle and Gorka Labaka and Ander Barrena and Eneko Agirre},
journal= {arXiv preprint arXiv:2109.03659},
year = {2021}
}
备注
Accepted at EMNLP2021