常识推理任务的合理性探究:以Winograd Schema Challenge与SWAG为例
机器学习
2021-09-27 v2 人工智能
计算与语言
机器学习
摘要
近期研究在常识推理(CSR)基准如Winograd Schema Challenge(WSC)和SWAG上的最优性能(SOTA)取得了显著改进。本文所提出的问题在于,这些基准上性能的提升是否代表了朝向具备常识能力的系统的真正进展。我们对两个基准进行了案例研究,并设计了协议,通过分析先前实验设计有效性所受的威胁,来澄清和限定先前工作的结果。我们的协议考虑了常识基准中普遍存在的若干特性,包括规模限制、结构规律性和实例难度可变。
引用
@article{arxiv.1811.01778,
title = {How Reasonable are Common-Sense Reasoning Tasks: A Case-Study on the Winograd Schema Challenge and SWAG},
author = {Paul Trichelair and Ali Emami and Adam Trischler and Kaheer Suleman and Jackie Chi Kit Cheung},
journal= {arXiv preprint arXiv:1811.01778},
year = {2021}
}
备注
7 pages