基于训练动态的 NLP 数据集过滤方法可能并不奏效
计算与语言
2021-09-21 v1 人工智能
摘要
近期数据集规模的增长为自然语言理解带来了显著进展。这些大型数据集通常通过自动化(搜索引擎或网络爬虫)或众包收集,这天然引入了错误标注数据。在这些数据集上训练会导致记忆与泛化能力差。因此,开发有助于识别并隔离误标数据的技术十分必要。本文中,我们研究了边际下面积(AUM)度量在自然语言处理数据集中识别并移除/纠正误标样本上的适用性。我们发现误标样本可通过 AUM 度量在 NLP 数据集中被过滤,但它也会移除大量正确标注点并导致大量相关语言信息的丢失。我们表明模型依赖分布信息而非句法和语义表示。
引用
@article{arxiv.2109.09191,
title = {Training Dynamic based data filtering may not work for NLP datasets},
author = {Arka Talukdar and Monika Dagar and Prachi Gupta and Varun Menon},
journal= {arXiv preprint arXiv:2109.09191},
year = {2021}
}
备注
EMNLP BlackBoxNLP 2021