NILE:带忠实自然语言解释的自然语言推理
计算与语言
2020-05-26 v1
摘要
近年来深度学习模型在 NLP 分类任务上的流行与成功,伴随着对预测标签生成某种自然语言解释的需求。此类生成的自然语言(NL)解释应当忠实,即应与模型内部决策良好相关。本工作中,我们聚焦于自然语言推理(NLI)任务,并探讨如下问题:我们能否构建在给出高准确率标签的同时生成忠实决策解释的 NLI 系统?我们提出针对标签特定解释的自然语言推理(NILE),一种利用自动生成的标签特定 NL 解释来产出标签及其忠实解释的崭新 NLI 方法。我们通过自动与人工评估所产出的标签与解释,展示了 NILE 相对于先前报道方法的有效性。我们对 NILE 的评估亦支持如下主张:能够对其决策提供可检验解释的准确系统是可以被设计的。我们依据决策对相应解释的敏感性讨论了 NILE 解释的忠实性。我们认为,除标签与解释准确率外,对忠实性的显式评估是评价模型解释的重要步骤。此外,我们证明任务特定探针对于确立此类敏感性是必要的。
引用
@article{arxiv.2005.12116,
title = {NILE : Natural Language Inference with Faithful Natural Language Explanations},
author = {Sawan Kumar and Partha Talukdar},
journal= {arXiv preprint arXiv:2005.12116},
year = {2020}
}
备注
13 pages, 3 figures, Accepted to ACL 2020