中文

评估自然语言生成中多样性的评测方法

计算与语言 2021-01-26 v3

摘要

尽管对产生多样化输出的自然语言生成(NLG)模型的兴趣日益增长,目前仍缺乏评估NLG系统多样性的原则性方法。本文提出一个评估多样性度量的框架。该框架度量所提多样性度量与多样性参数之间的相关性,后者为控制生成文本某方面多样性的单一参数。例如,多样性参数可以是用于指示众包工作者生成低或高内容多样性文本的二元变量。我们通过以下方式展示框架效用:(a) 确立从人类获取多样性判断的最佳实践,(b) 表明在估计内容多样性方面人类大幅优于自动度量,以及 (c) 证明现有通过调节“解码参数”控制多样性的方法主要影响形式而非意义。我们的框架可推进对不同多样性度量的理解,这是通向更优NLG系统之路上的关键一步。

关键词

引用

@article{arxiv.2004.02990,
  title  = {Evaluating the Evaluation of Diversity in Natural Language Generation},
  author = {Guy Tevet and Jonathan Berant},
  journal= {arXiv preprint arXiv:2004.02990},
  year   = {2021}
}