评估机器阅读理解模型对低资源实体替换的鲁棒性
计算与语言
2024-04-18 v2
摘要
问答(QA)模型在机器阅读理解(MRC)任务中展现出引人注目的结果。最近这些系统在 SQuAD 等数据集的留出测试集上被证明优于人类,但其鲁棒性并未得到保证。当在对抗生成样本上评估时,QA 模型的脆弱性通过性能下降暴露出来。本研究探讨了 MRC 模型对实体替换的鲁棒性,实体来自非洲等低资源地区。我们提出 EntSwap,一种测试时扰动方法,用于创建实体已被替换的测试集。具体而言,我们将国家、人物、国籍、地点、组织和城市类型的实体重命名,以创建 AfriSQuAD2。使用扰动测试集,我们评估了三种流行 MRC 模型的鲁棒性。我们发现,与基础模型相比,大型模型在新颖实体上表现相对更好。此外,我们的分析表明人物类型实体极大挑战了 MRC 模型的性能。
引用
@article{arxiv.2304.03145,
title = {Evaluating the Robustness of Machine Reading Comprehension Models to Low Resource Entity Renaming},
author = {Clemencia Siro and Tunde Oluwaseyi Ajayi},
journal= {arXiv preprint arXiv:2304.03145},
year = {2024}
}
备注
Accepted at The AfricaNLP Workshop 2023 colocated with ICLR 2023