WinoWhy:对回答 Winograd Schema Challenge 所需核心常识知识的深度诊断
人工智能
2020-05-13 v1 计算与语言
摘要
在本文中,我们首次对回答 Winograd Schema Challenge(WSC)所需的核心常识知识进行了全面分类。对于每个问题,我们邀请标注者首先提供做出正确决策的理由,然后将它们分为六个主要知识类别。通过这样做,我们更好地理解了现有方法的局限性(即,哪些知识无法用现有方法有效表示或推断),并为未来更好的常识推理所需获取的常识知识提供了一些启示。此外,为了研究当前的 WSC 模型是能够理解常识,还是仅仅基于数据集的统计偏差来解决 WSC 问题,我们利用收集到的理由开发了一个名为 WinoWhy 的新任务,该任务要求模型为所有 WSC 问题区分合理理由与非常相似但错误的理由。实验结果证明,尽管预训练语言表示模型在原始 WSC 数据集上取得了可喜的进展,但它们在 WinoWhy 上仍然表现挣扎。进一步的实验表明,尽管监督模型可以实现更好的性能,但这些模型的性能可能对数据集分布敏感。WinoWhy 及所有代码可在以下地址获取:https://github.com/HKUST-KnowComp/WinoWhy。
引用
@article{arxiv.2005.05763,
title = {WinoWhy: A Deep Diagnosis of Essential Commonsense Knowledge for Answering Winograd Schema Challenge},
author = {Hongming Zhang and Xinran Zhao and Yangqiu Song},
journal= {arXiv preprint arXiv:2005.05763},
year = {2020}
}
备注
Accepted by ACL 2020