IDK-MRC:面向印尼语机器阅读理解的无答案问题数据集
计算与语言
2022-10-26 v1
摘要
机器阅读理解(MRC)已成为自然语言理解(NLU)的基本任务之一,因其常被纳入若干 NLU 基准(Liang et al., 2020; Wilie et al., 2020)。然而,多数 MRC 数据集仅含可回答题型,忽视了无答案问题的重要性。仅在可回答问题上训练的 MRC 模型会选择最可能为答案的跨度,即便答案在给定段落中实际并不存在(Rajpurkar et al., 2018)。该问题在印尼语等中低资源语言中尤为突出。现有印尼语 MRC 数据集(Purwarianti et al., 2007; Clark et al., 2020)仍不充分,因其规模小且题型有限,即仅覆盖可回答问题。为填补此空白,我们构建了名为 I(n)don'tKnow-MRC (IDK-MRC) 的新印尼语 MRC 数据集,结合自动与人工无答案问题生成,以在保持数据质量的同时最小化人工构建成本。结合已有可回答问题,IDK-MRC 总计含逾 1 万道问题。我们的分析表明,该数据集显著提升了印尼语 MRC 模型性能,在无答案问题上改善尤大。
引用
@article{arxiv.2210.13778,
title = {IDK-MRC: Unanswerable Questions for Indonesian Machine Reading Comprehension},
author = {Rifki Afina Putri and Alice Oh},
journal= {arXiv preprint arXiv:2210.13778},
year = {2022}
}
备注
EMNLP 2022