中文

BERT 从多选阅读理解数据集中学到了什么?

计算与语言 2019-10-29 v1

摘要

多选阅读理解(MCRC)要求模型阅读篇章与问题,并从给定选项中选出正确答案。近期最先进的模型在多个 MCRC 数据集上取得了令人印象深刻的性能。然而,此类性能或许并不能反映模型真正的语言理解与推理能力。本工作中,我们采用两种方法来探究 BERT 从 MCRC 数据集中学到了什么:1)不可读数据攻击,即添加关键词以混淆 BERT,导致其性能显著下降;2)不可回答数据训练,即在部分或打乱的输入上训练 BERT。在不可回答数据训练下,BERT 取得了出乎意料的高性能。基于我们在 5 个关键 MCRC 数据集——RACE、MCTest、MCScript、MCScript2.0、DREAM——上的实验,我们观察到:1)微调后的 BERT 主要学习关键词如何导向正确预测,而非学习语义理解与推理;2)BERT 解决该任务并不需要正确的句法信息;3)这些数据集中存在伪特征,使得即便没有完整上下文也能被解答。

关键词

引用

@article{arxiv.1910.12391,
  title  = {What does BERT Learn from Multiple-Choice Reading Comprehension Datasets?},
  author = {Chenglei Si and Shuohang Wang and Min-Yen Kan and Jing Jiang},
  journal= {arXiv preprint arXiv:1910.12391},
  year   = {2019}
}

备注

10 pages