中文

自然语言生成中多样性与质量的权衡

计算与语言 2020-04-23 v1

摘要

对于故事生成和对话等开放式语言生成任务,选择合适的解码算法对于控制生成质量与多样性之间的权衡至关重要。然而,目前对于哪种解码方法最佳,甚至用于比较它们的标准,尚不存在共识。我们将这些问题归结为把解码视为一个多目标优化问题,旨在同时最大化回复质量与多样性。我们的框架使我们能够首次沿着整个质量-多样性谱对解码方法进行大规模评估。我们发现,当多样性优先时,所有方法表现相似;但当质量被视为更重要时,最近提出的核采样(nucleus sampling,Holtzman 等人 2019)优于所有其他被评估的解码算法。我们的实验也证实了“似然陷阱”的存在,即高似然序列往往出奇地低质量这一反直觉现象。我们利用我们的发现创建并评估了一种称为选择性采样(selective sampling)的算法,该算法可易处理地近似全局归一化温度采样。

关键词

引用

@article{arxiv.2004.10450,
  title  = {Trading Off Diversity and Quality in Natural Language Generation},
  author = {Hugh Zhang and Daniel Duckworth and Daphne Ippolito and Arvind Neelakantan},
  journal= {arXiv preprint arXiv:2004.10450},
  year   = {2020}
}