中文

自然语言解释评估的自动度量研究

计算与语言 2021-07-08 v1 人工智能

摘要

随着透明度成为机器人与 AI 的关键,有必要评估提供透明度的各类方法,包括自动生成的自然语言(NL)解释。在此,我们探讨此类解释的生成与已被充分研究的自然语言生成(NLG)评估领域之间的相似性。具体地,我们考察哪些 NLG 评估度量适用于解释。我们提出 ExBAN 语料库:一个众包获取的贝叶斯网络 NL 解释语料库。我们运行相关性分析,将人类主观评分与 NLG 自动度量进行比较。我们发现,基于嵌入的自动 NLG 评估方法(如 BERTScore 和 BLEURT)相较于词重叠度量(如 BLEU 和 ROUGE)与人类评分具有更高的相关性。本工作对可解释 AI 及透明机器人与自治系统具有启示意义。

关键词

引用

@article{arxiv.2103.08545,
  title  = {A Study of Automatic Metrics for the Evaluation of Natural Language Explanations},
  author = {Miruna Clinciu and Arash Eshghi and Helen Hastie},
  journal= {arXiv preprint arXiv:2103.08545},
  year   = {2021}
}

备注

Accepted at EACL 2021