中文

以偏制偏:通过放大数据集偏差提升模型鲁棒性

计算与语言 2023-05-31 v1

摘要

NLP 模型常依赖被称为数据集偏差的表层线索取得令人印象深刻的性能,并可能在偏差不成立的样本上失效。近期工作试图通过从训练集中过滤有偏样本来开发鲁棒、无偏的模型。在本文中,我们认为此类过滤会掩盖模型克服偏差的真实能力,而这些偏差可能永远无法从数据集中完全移除。我们提出,为推动开发对细微偏差鲁棒的模型,应在训练集中放大数据集偏差。我们引入了一个由偏差放大训练集和反偏差测试集定义的评估框架,二者均从现有数据集中自动提取。跨越三种偏差概念、四个数据集和两种模型的实验表明,我们的框架对模型而言比原始数据划分更具挑战性,甚至比手工构建的挑战集更具挑战性。我们的评估框架可使用任何现有数据集(即便是被认为过时的)来测试模型鲁棒性。我们希望我们的工作能指导开发不依赖表层偏差与相关的鲁棒模型。为此,我们公开发布了代码与数据。

关键词

引用

@article{arxiv.2305.18917,
  title  = {Fighting Bias with Bias: Promoting Model Robustness by Amplifying Dataset Biases},
  author = {Yuval Reif and Roy Schwartz},
  journal= {arXiv preprint arXiv:2305.18917},
  year   = {2023}
}

备注

Findings of ACL 2023