让每个样本都发挥作用:论自影响在从含噪 NLP 数据集学习中的稳定性与效用
计算与语言
2023-10-18 v2
摘要
规模日益增大的数据集已成为推动 NLP 领域前沿进展的标准要素。然而,数据质量或许已成为进一步获益的瓶颈。鉴于现代数据集的多样性和规模,标准数据过滤不易直接应用,因为有害数据的多面性以及可跨多个任务泛化的过滤规则的难以捉摸。我们研究了训练样本的任务无关自影响分数用于数据清洗的适用性,分析了其在捕捉自然出现的离群点方面的效力,并探讨了基于自影响的数据清洗能在多大程度上提升机器翻译、问答和文本分类中的下游性能,该工作建立在近期自影响计算和自动课程学习的方法之上。
引用
@article{arxiv.2302.13959,
title = {Make Every Example Count: On the Stability and Utility of Self-Influence for Learning from Noisy NLP Datasets},
author = {Irina Bejan and Artem Sokolov and Katja Filippova},
journal= {arXiv preprint arXiv:2302.13959},
year = {2023}
}
备注
Published at EMNLP 2023