中文

自然语言句子匹配数据集的选择偏差探究与去偏方法

计算与语言 2019-06-11 v4 人工智能

摘要

自然语言句子匹配(NLSM)已受到学术界与工业界的广泛关注,丰富的公开数据集对此进程贡献良多。然而,有偏差的数据集也会损害训练模型的泛化性能,并给出不可靠的评估结果。对于许多 NLSM 数据集,提供方将若干句子对选入数据集中,这一采样过程容易引入非预期的模式,即选择偏差。一个例子是 QuoraQP 数据集,其中某些与内容无关的朴素特征具有不合理的预测性。此类特征是选择偏差的反映,被称为泄漏特征(leakage features)。本文研究了六个 NLSM 数据集上的选择偏差问题,发现其中四个存在显著偏差。我们进一步提出一种训练与评估框架以缓解该偏差。在 QuoraQP 上的实验结果表明,所提框架能够提升训练模型的泛化能力,并为实际应用给出更可信的评估结果。

关键词

引用

@article{arxiv.1905.06221,
  title  = {Selection Bias Explorations and Debias Methods for Natural Language Sentence Matching Datasets},
  author = {Guanhua Zhang and Bing Bai and Jian Liang and Kun Bai and Shiyu Chang and Mo Yu and Conghui Zhu and Tiejun Zhao},
  journal= {arXiv preprint arXiv:1905.06221},
  year   = {2019}
}

备注

Accepted by ACL 2019