关注真实世界扰动!机器阅读理解中的自然鲁棒性评估
计算与语言
2025-09-11 v2 人工智能
摘要
随着神经语言模型在机器阅读理解(Machine Reading Comprehension, MRC)上实现接近人类的性能并获得广泛应用,确保其在现实场景下的鲁棒性变得越来越重要。然而,当前的鲁棒性评估研究主要开发合成扰动方法,尚不清楚它们是否反映真实情境。考虑到这一点,我们提出了一个框架,自动性地检查MRC模型在自然发生的文本扰动上的表现,通过替换MRC基准数据集中的段落,其对应性来自可获得的维基百科编辑历史。这种扰动类型是自然的,因为其设计不源于人工生成过程,本质上与先前研究的合成方法截然不同。在大规模研究涵盖SQUAD数据集和各种模型架构时,我们观察到自然扰动导致预训练编码器语言模型性能下降。更令人担忧的是,这些最先进的Flan-T5和大型语言模型(LLM)继承了这些错误。进一步的实验表明,我们的发现适用于发现于其他更具挑战性MRC基准中的自然扰动。在努力缓解这些错误方面,我们展示,通过在自然或合成扰动示例上训练,仍可提高对自然扰动的鲁棒性,尽管与未扰动数据表现之间仍存在可观的差距。
引用
@article{arxiv.2502.16523,
title = {Pay Attention to Real World Perturbations! Natural Robustness Evaluation in Machine Reading Comprehension},
author = {Yulong Wu and Viktor Schlegel and Riza Batista-Navarro},
journal= {arXiv preprint arXiv:2502.16523},
year = {2025}
}