论数据集平衡的局限性:对抗虚假相关性的必败之战
计算与语言
2022-04-28 v1
摘要
近期研究表明,自然语言处理(NLP)中的深度学习模型对简单特征与特定输出标签之间的低层相关性高度敏感,导致过拟合和泛化能力不足。为缓解这一问题,常见做法是通过添加新实例或过滤“简单”实例来平衡数据集(Sakaguchi 等,2020),最终发展为一项近期提议,即完全消除单词语相关性(Gardner 等,2021)。在这篇观点论文中,我们指出,尽管做出了这些努力,日益强大的模型仍在不断利用越来越微小的虚假相关性,因此即使平衡所有单词语特征也不足以缓解所有这些相关性。与此同时,一个真正平衡的数据集可能注定会“把孩子和洗澡水一起倒掉”,从而丢失编码常识和世界知识的重要信号。我们着重介绍了数据集平衡之外的几种替代方案,侧重于用更丰富的上下文增强数据集、允许模型弃权并与用户交互,以及从大规模微调转向零样本或少样本设置。
引用
@article{arxiv.2204.12708,
title = {On the Limitations of Dataset Balancing: The Lost Battle Against Spurious Correlations},
author = {Roy Schwartz and Gabriel Stanovsky},
journal= {arXiv preprint arXiv:2204.12708},
year = {2022}
}
备注
Findings of NAACL 2022