挑战ELECTRA的常识知识对抗数据集
计算与语言
2020-10-27 v1
摘要
常识知识在人类阅读理解中至关重要。尽管机器理解近年取得显著进展,其处理常识知识的能力仍有限。同义词是应用最广泛的常识知识之一。构建对抗数据集是发现机器理解模型弱点并支撑解决方案设计的重要途径。为探究机器理解模型处理常识知识的能力,我们创建了具备同义词常识的问答数据集(QADS)。QADS是基于SQuAD 2.0应用同义词常识生成的问答。同义词提取自WordNet。词常具有多义与多个同义词。我们采用增强Lesk算法进行词义消歧以识别上下文中的同义词。ELECTRA在2019年SQuAD 2.0上取得最优结果。通过规模扩展,ELECTRA可达到与BERT相近的性能。然而,QADS显示ELECTRA几乎不具备处理同义词常识的能力。在我们的实验中,ELECTRA-small在SQuAD 2.0上可达70%准确率,但在QADS上仅20%。ELECTRA-large表现未好太多:其在SQuAD 2.0上准确率88%,在QADS上显著跌至26%。在早前实验中,BERT虽也在QADS上严重失败,但情况不如ELECTRA糟糕。结果表明,即便顶尖NLP模型也几乎不具备阅读理解所必需的常识处理能力。
引用
@article{arxiv.2010.13049,
title = {Commonsense knowledge adversarial dataset that challenges ELECTRA},
author = {Gongqi Lin and Yuan Miao and Xiaoyong Yang and Wenwu Ou and Lizhen Cui and Wei Guo and Chunyan Miao},
journal= {arXiv preprint arXiv:2010.13049},
year = {2020}
}
备注
To appear in ICARCV2020