中文

DuReader_robust:面向评估真实应用场景中机器阅读理解鲁棒性与泛化能力的中文数据集

计算与语言 2021-07-22 v2

摘要

机器阅读理解(MRC)是自然语言处理中的一项关键任务,并已取得显著进展。然而,大多数神经 MRC 模型仍远未具备鲁棒性,且无法在真实应用场景中良好泛化。为了全面验证 MRC 模型的鲁棒性与泛化能力,我们引入了一个真实世界的中文数据集——DuReader_robust。它旨在从过敏感、过稳定和泛化三个方面评估 MRC 模型。与以往工作相比,DuReader_robust 中的样本是自然文本,而非被改动的非自然文本。它呈现了将 MRC 模型应用于真实场景时所面临的挑战。实验结果表明,MRC 模型在该挑战测试集上表现不佳。此外,我们分析了现有模型在挑战测试集上的行为,这可为未来的模型开发提供建议。该数据集与代码已公开于 https://github.com/baidu/DuReader。

关键词

引用

@article{arxiv.2004.11142,
  title  = {DuReader_robust: A Chinese Dataset Towards Evaluating Robustness and Generalization of Machine Reading Comprehension in Real-World Applications},
  author = {Hongxuan Tang and Hongyu Li and Jing Liu and Yu Hong and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2004.11142},
  year   = {2021}
}