机器阅读理解模型鲁棒性基准评测
计算与语言
2021-05-27 v2
摘要
机器阅读理解(MRC)是评估模型自然语言理解(NLU)能力的重要试验台。该领域进展迅速,新模型在各基准上取得令人印象深刻的性能。然而,现有基准仅在域内测试集上评估模型,未考虑其在测试时扰动或对抗攻击下的鲁棒性。为填补这一重要空白,我们构建了 AdvRACE(Adversarial RACE),一个新的模型无关基准,用于在四类不同对抗攻击下评估 MRC 模型的鲁棒性,包括我们新颖的干扰项抽取与生成攻击。我们表明最先进的(SOTA)模型对所有这些攻击均脆弱。我们得出结论:构建更鲁棒的 MRC 模型仍有很大空间,且我们的基准可帮助推动并衡量该领域的进展。我们在 https://github.com/NoviScl/AdvRACE 发布了数据与代码。
引用
@article{arxiv.2004.14004,
title = {Benchmarking Robustness of Machine Reading Comprehension Models},
author = {Chenglei Si and Ziqing Yang and Yiming Cui and Wentao Ma and Ting Liu and Shijin Wang},
journal= {arXiv preprint arXiv:2004.14004},
year = {2021}
}
备注
ACL 2021 (Findings)