利用预训练语言模型检测标签错误
计算与语言
2022-12-16 v3
摘要
我们表明,大型预训练语言模型本身极具识别自然语言数据集中标签错误的能力:简单地按微调任务损失降序检查样本外数据点,就显著优于先前工作提出的更复杂的错误检测机制。为此,我们贡献了一种将真实、人类来源的标签噪声引入现有众包数据集(如 SNLI 和 TweetNLP)的新方法。我们表明该噪声具有与真实、人工核验的标签错误相似的特性,且比现有合成噪声更难检测,为模型鲁棒性带来挑战。我们认为人类来源的噪声是比合成噪声更好的评估标准。最后,我们利用众包核验来评估在 IMDB、Amazon Reviews 和 Recon 上对真实错误的检测,并确认预训练模型的精确率-召回率曲线下面积(Area Under the Precision-Recall Curve)绝对百分比比现有模型高 9–36%。
引用
@article{arxiv.2205.12702,
title = {Detecting Label Errors by using Pre-Trained Language Models},
author = {Derek Chong and Jenny Hong and Christopher D. Manning},
journal= {arXiv preprint arXiv:2205.12702},
year = {2022}
}
备注
18 pages, 10 figures. Accepted to EMNLP 2022; typesetting of this version slightly differs from conference version