关系分类数据集 TACRED 中的噪声:特征分析与消减
计算与语言
2023-11-22 v1 人工智能
摘要
本文的总体目标有两个。第一,探索基于模型的方法来刻画 TACRED 这一关系抽取(RE)数据集中噪声的主要成因。第二,识别潜在含噪样本。针对第一个目标,我们分析最先进(SOTA)模型的预测与性能,以定位数据集噪声的根源。我们对 TACRED 的分析表明,数据集中大部分噪声源自标记为无关系(no-relation)的样本,这些属于负例。针对第二个目标,我们探索两种基于最近邻的策略,自动识别潜在含噪负例以进行剔除与重新标注。我们的第一种策略称为内在策略(IS),其假设正例是干净的,因此我们利用假阴性预测来识别含噪负例。而第二种方法称为外在策略(ES),基于使用数据集的一个干净子集来识别潜在含噪负例。最后,我们在剔除并重新标注的数据集上重新训练 SOTA 模型。基于两个在 TACRED-E(经 IS 处理)上训练的 SOTA 模型的实证结果显示平均 F1 分数提升 4%,而重新标注(TACRED-R)并未改善原始结果。然而,遵循 ES 时,SOTA 模型在 respective 剔除(TACRED-EN)与重新标注(TACRED-RN)数据集上训练分别显示平均 F1 分数提升 3.8% 与 4.4%。我们进一步将 ES 扩展至清洗正例,相应剔除(TACRED-ENP)与重新标注(TACRED-RNP)数据集分别带来平均 5.8% 与 5.6% 的性能提升。
引用
@article{arxiv.2311.12298,
title = {Noise in Relation Classification Dataset TACRED: Characterization and Reduction},
author = {Akshay Parekh and Ashish Anand and Amit Awekar},
journal= {arXiv preprint arXiv:2311.12298},
year = {2023}
}
备注
Work in Progress