中文

关于在自然语言生成评测中开展更好的自动指标验证研究

计算与语言 2019-08-01 v1

摘要

自然语言生成(NLG)受到越来越多的关注,这也凸显了评测作为核心方法论问题的重要性。由于对这些系统的人工评测成本高昂,自动指标在NLG中具有广泛吸引力。语言生成研究常遇到适合应用现有指标或提出新指标的情形。这些指标的应用完全依赖于验证研究——即确定指标与人工判断相关性的研究。然而,开展有力的验证研究涉及诸多细节与考量。本文档面向在广义NLG背景下验证现有指标或提出新指标的研究者:我们1)首先撰写验证研究中的最佳实践,2)概述如何采纳这些实践,3)在WMT'17指标共享任务中开展分析\footnote{包含分析的jupyter notebook见\url{https://github.com}},4)强调NLG指标中有前景的方法,5)以我们对该领域未来的看法作结。

关键词

引用

@article{arxiv.1907.13362,
  title  = {On conducting better validation studies of automatic metrics in natural language generation evaluation},
  author = {Johnny Tian-Zheng Wei},
  journal= {arXiv preprint arXiv:1907.13362},
  year   = {2019}
}

备注

Rejected from the NAACL Workshop on Methods for Optimizing and Evaluating Neural Language Generation