自然语言推理中忠实解释的反事实逻辑可满足性
计算与语言
2022-05-26 v1
摘要
出于信任、可解释性以及诊断模型错误来源等诸多原因,评估解释的忠实性备受期待。在这项聚焦于 NLI(自然语言推理)任务的工作中,我们引入了“通过反事实实现忠实性”(Faithfulness-through-Counterfactuals)的方法论:首先基于解释中所表达的逻辑谓词生成反事实假设,然后评估模型在该反事实上的预测是否与所表达的逻辑一致(即新公式是否\textit{逻辑可满足})。与现有方法不同,这不需要任何解释来训练一个独立的验证模型。我们首先利用少样本提示(few-shot priming)范式验证了自动生成反事实假设的有效性。接着,我们表明所提出的度量能够区分人类与模型在新反事实输入上的一致与不一致。此外,我们进行了敏感性分析,以验证该度量对不忠实解释具有敏感性。
引用
@article{arxiv.2205.12469,
title = {Logical Satisfiability of Counterfactuals for Faithful Explanations in NLI},
author = {Suzanna Sia and Anton Belyy and Amjad Almahairi and Madian Khabsa and Luke Zettlemoyer and Lambert Mathias},
journal= {arXiv preprint arXiv:2205.12469},
year = {2022}
}
备注
Under Review