中文

机器阅读理解模型鲁棒性基准评测

计算与语言 2021-05-27 v2

摘要

机器阅读理解(MRC)是评估模型自然语言理解(NLU)能力的重要试验台。该领域进展迅速,新模型在各基准上取得令人印象深刻的性能。然而,现有基准仅在域内测试集上评估模型,未考虑其在测试时扰动或对抗攻击下的鲁棒性。为填补这一重要空白,我们构建了 AdvRACE(Adversarial RACE),一个新的模型无关基准,用于在四类不同对抗攻击下评估 MRC 模型的鲁棒性,包括我们新颖的干扰项抽取与生成攻击。我们表明最先进的(SOTA)模型对所有这些攻击均脆弱。我们得出结论:构建更鲁棒的 MRC 模型仍有很大空间,且我们的基准可帮助推动并衡量该领域的进展。我们在 https://github.com/NoviScl/AdvRACE 发布了数据与代码。

关键词

引用

@article{arxiv.2004.14004,
  title  = {Benchmarking Robustness of Machine Reading Comprehension Models},
  author = {Chenglei Si and Ziqing Yang and Yiming Cui and Wentao Ma and Ting Liu and Shijin Wang},
  journal= {arXiv preprint arXiv:2004.14004},
  year   = {2021}
}

备注

ACL 2021 (Findings)