中文

神经文本退化的奇特现象

计算与语言 2020-02-18 v2

摘要

尽管深度神经语言模型取得了显著进展,但当这些模型作为文本生成器进行测试时,神经文本退化的谜团依然存在。反直觉的经验观察是:尽管使用似然作为训练目标在广泛的语言理解任务中带来了高质量模型,但使用似然作为解码目标却会导致平淡且奇怪重复的文本。在本文中,我们揭示了人类文本与机器文本之间令人惊讶的分布差异。此外,我们发现仅解码策略就能极大地影响机器文本的质量,即使是由完全相同的神经语言模型生成也是如此。我们的发现催生了核采样(Nucleus Sampling),一种简单而有效的方法,以充分发挥神经生成的最佳性能。通过从概率分布的动态核中采样文本,在保持多样性的同时有效截断分布中可靠性较低的尾部,所得文本更好地展现了人类文本的质量,在增强多样性的同时不牺牲流畅性与连贯性。

关键词

引用

@article{arxiv.1904.09751,
  title  = {The Curious Case of Neural Text Degeneration},
  author = {Ari Holtzman and Jan Buys and Li Du and Maxwell Forbes and Yejin Choi},
  journal= {arXiv preprint arXiv:1904.09751},
  year   = {2020}
}

备注

Published in ICLR 2020