中文

自然语言生成系统所用评估指标综述

计算与语言 2020-10-06 v2

摘要

深度学习的成功引发了对广泛自然语言生成(NLG)任务的兴趣激增。深度学习不仅推动了若干已有 NLG 任务的技术水平,还促使研究者探索诸如图像描述等各种较新的 NLG 任务。NLG such 的快速进展有必要开发准确的自动评估指标,以追踪 NLG 领域的进步。然而,与分类任务不同,自动评估 NLG 系统本身是一项巨大挑战。若干工作已表明,BLEU、ROUGE 等早期基于启发式的指标不足以捕捉不同 NLG 任务中的细微差别。NLG 模型数量的扩张与当前指标的缺陷导致自 2014 年以来所提出的评估指标数量急剧上升。此外,各类评估指标已从使用预先确定的基于启发式的公式转向训练好的 transformer 模型。这种在相对短时间内发生的快速变化,使得有必要对现有 NLG 指标进行综述,以帮助现有及新研究者快速跟上近年来 NLG 评估的发展。通过本综述,我们首先希望强调自动评估 NLG 系统的挑战与困难。随后,我们提供了一套连贯的评估指标分类法,以组织现有指标并更好理解该领域的发展。我们还详细描述了不同指标并强调其关键贡献。接着,我们讨论现有指标中识别出的主要缺陷,并描述用于评估评估指标的方法论。最后,我们讨论关于改进自动评估指标后续步骤的建议与推荐。

关键词

引用

@article{arxiv.2008.12009,
  title  = {A Survey of Evaluation Metrics Used for NLG Systems},
  author = {Ananya B. Sai and Akash Kumar Mohankumar and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2008.12009},
  year   = {2020}
}

备注

A condensed version of this paper is submitted to ACM CSUR