MRQA 2019 共享任务:阅读理解泛化能力评测
计算与语言
2019-12-24 v2
摘要
我们呈现了机器阅读理解问答(Machine Reading for Question Answering, MRQA)2019 共享任务关于评测阅读理解系统泛化能力的结果。在该任务中,我们将 18 个不同的问答数据集适配并统一为相同格式。其中六个数据集用于训练,六个用于开发,最后六个隐藏用于最终评测。十个团队提交了系统,探索了包括数据采样、多任务学习、对抗训练和集成在内的多种思路。最佳系统在 12 个留出数据集上取得了平均 F1 分数 72.5,比我们基于 BERT 的初始基线高出 10.7 个绝对百分点。
引用
@article{arxiv.1910.09753,
title = {MRQA 2019 Shared Task: Evaluating Generalization in Reading Comprehension},
author = {Adam Fisch and Alon Talmor and Robin Jia and Minjoon Seo and Eunsol Choi and Danqi Chen},
journal= {arXiv preprint arXiv:1910.09753},
year = {2019}
}
备注
EMNLP 2019 Workshop on Machine Reading for Question Answering