中文

不要丢弃所有有偏样本:对数据集偏差缓解技术核心假设的探究

机器学习 2021-09-03 v1 计算与语言

摘要

现有的数据集偏差缓解技术通常利用一个有偏模型来识别有偏样本。在训练主模型时,这些有偏样本的作用会被削弱,以增强其对分布外数据的鲁棒性。这些技术的一个常见核心假设是,主模型处理有偏样本的方式与有偏模型相似,即只要存在偏差就会利用它们。在本文中,我们表明这一假设在一般情况下并不成立。我们对领域内两个知名数据集 MNLI 和 FEVER,以及两种有偏样本检测方法(部分输入模型和有限容量模型)进行了批判性研究。我们的实验表明,在约三分之一到一半的样本中,有偏模型无法预测主模型的行为,这体现在二者基于输入中显著不同的部分做出决策。基于人工验证,我们还表明这一估计与人工解读高度一致。我们的发现表明,降低由偏差检测方法所识别样本的权重(一种被广泛采用的流程)是对训练数据的不必要浪费。我们发布了代码以促进可复现性和未来研究。

关键词

引用

@article{arxiv.2109.00521,
  title  = {Don't Discard All the Biased Instances: Investigating a Core Assumption in Dataset Bias Mitigation Techniques},
  author = {Hossein Amirkhani and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2109.00521},
  year   = {2021}
}

备注

Findings of EMNLP, 2021