中文

为何 NLG 需要新的评估指标

计算与语言 2017-09-18 v1

摘要

大多数 NLG 评估依赖于自动指标,例如 BLEU。在本文中,我们论证了需要新颖的、独立于系统和数据的自动评估方法:我们研究了广泛的指标,包括最先进的基于词的指标和新颖的基于语法的指标,并证明它们仅能微弱地反映人类对由数据驱动的端到端 NLG 所生成系统输出的判断。我们还表明,指标性能是特定于数据和系统的。尽管如此,我们的结果也表明,自动指标在系统级别上表现可靠,并且可以通过发现系统表现不佳的情况来支持系统开发。

关键词

引用

@article{arxiv.1707.06875,
  title  = {Why We Need New Evaluation Metrics for NLG},
  author = {Jekaterina Novikova and Ondřej Dušek and Amanda Cercas Curry and Verena Rieser},
  journal= {arXiv preprint arXiv:1707.06875},
  year   = {2017}
}

备注

accepted to EMNLP 2017