自然语言解释评估的自动度量研究
计算与语言
2021-07-08 v1 人工智能
摘要
随着透明度成为机器人与 AI 的关键,有必要评估提供透明度的各类方法,包括自动生成的自然语言(NL)解释。在此,我们探讨此类解释的生成与已被充分研究的自然语言生成(NLG)评估领域之间的相似性。具体地,我们考察哪些 NLG 评估度量适用于解释。我们提出 ExBAN 语料库:一个众包获取的贝叶斯网络 NL 解释语料库。我们运行相关性分析,将人类主观评分与 NLG 自动度量进行比较。我们发现,基于嵌入的自动 NLG 评估方法(如 BERTScore 和 BLEURT)相较于词重叠度量(如 BLEU 和 ROUGE)与人类评分具有更高的相关性。本工作对可解释 AI 及透明机器人与自治系统具有启示意义。
引用
@article{arxiv.2103.08545,
title = {A Study of Automatic Metrics for the Evaluation of Natural Language Explanations},
author = {Miruna Clinciu and Arash Eshghi and Helen Hastie},
journal= {arXiv preprint arXiv:2103.08545},
year = {2021}
}
备注
Accepted at EACL 2021