语言模型与人类对 Winograd 模式扰动的敏感性
计算与语言
2020-05-08 v2 机器学习
摘要
大规模预训练语言模型是近期 Winograd 模式挑战(一项被广泛使用的常识推理能力测试)性能提升的主要驱动力。然而,我们通过一个新的诊断数据集表明,这些模型对 Winograd 示例的语言学扰动敏感,而此类扰动对人类理解的影响极小。我们的结果凸显了人类与语言模型之间有趣的差异:语言模型比人类对数或性别变换以及同义词替换更敏感,而人类在其预测中更稳定一致,保持高得多的绝对性能,并且在非关联实例上比关联实例表现更好。总体而言,人类正确的频率高于开箱即用模型,且模型有时出于错误的原因而正确。最后,我们表明在大型任务特定数据集上微调可为这些问题提供解决方案。
引用
@article{arxiv.2005.01348,
title = {The Sensitivity of Language Models and Humans to Winograd Schema Perturbations},
author = {Mostafa Abdou and Vinit Ravishankar and Maria Barrett and Yonatan Belinkov and Desmond Elliott and Anders Søgaard},
journal= {arXiv preprint arXiv:2005.01348},
year = {2020}
}
备注
ACL 2020