中文

利用对抗攻击揭示机器阅读理解模型中的统计偏置

计算与语言 2021-05-26 v2

摘要

预训练语言模型已在许多机器阅读理解(MRC)任务上取得人类水平的表现,但尚不清楚这些模型是真正理解了语言,还是通过利用数据集中的统计偏置来回答问题。在此,我们展示一种简单而有效的攻击 MRC 模型并揭示这些模型中统计偏置的方法。我们将该方法应用于 RACE 数据集,其中每个 MRC 问题的答案从 4 个选项中选出。研究发现,包括 BERT、ALBERT 和 RoBERTa 在内的若干预训练语言模型对某些选项表现出一致的偏好,即便这些选项与问题无关。当受到这些无关选项干扰时,MRC 模型的表现可从人类水平降至随机水平。然而,人类读者并未明显受这些无关选项影响。最后,我们提出一种增强训练方法,可大幅降低模型的统计偏置。

关键词

引用

@article{arxiv.2105.11136,
  title  = {Using Adversarial Attacks to Reveal the Statistical Bias in Machine Reading Comprehension Models},
  author = {Jieyu Lin and Jiajie Zou and Nai Ding},
  journal= {arXiv preprint arXiv:2105.11136},
  year   = {2021}
}

备注

Accepted by ACL 2021