难例是否也更难解释?一项基于人类与模型生成解释的研究
计算与语言
2022-11-15 v1 人工智能
摘要
近期可解释 NLP 的研究表明,少样本提示可使大型预训练语言模型(LLM)为数据标签生成符合语法且事实正确的自然语言解释。在这项工作中,我们通过探究以下研究问题来研究可解释性与样本难度之间的联系——“LLM 与人类在解释易样本和难样本的数据标签上是否同样出色?”我们通过首先在 Winograd Schema Challenge(Winogrande 数据集)任务上以可泛化的常识规则形式收集人类撰写的解释来回答此问题。我们将这些解释与 GPT-3 生成的解释进行比较,同时改变测试样本与上下文样本的硬度。我们观察到:(1)无论测试样本难度如何,GPT-3 解释在语法上与人类解释同样好;(2)对于简单示例,GPT-3 生成高度支持性解释,但人类解释更具可泛化性;(3)对于困难示例,无论在与标签的支持性还是可泛化性判断上,人类解释均显著优于 GPT-3 解释。我们还发现上下文示例的难度会影响 GPT-3 解释的质量。最后,我们表明人类解释的支持性与可泛化性方面也受样本难度影响,尽管幅度远小于模型。支持代码与数据见 https://github.com/swarnaHub/ExplanationHardness
引用
@article{arxiv.2211.07517,
title = {Are Hard Examples also Harder to Explain? A Study with Human and Model-Generated Explanations},
author = {Swarnadeep Saha and Peter Hase and Nazneen Rajani and Mohit Bansal},
journal= {arXiv preprint arXiv:2211.07517},
year = {2022}
}
备注
EMNLP 2022 (11 pages)