中文

Mirostat:一种直接控制困惑度的神经文本解码算法

计算与语言 2021-01-18 v2 信息论 math.IT

摘要

神经文本解码对于使用语言模型生成高质量文本十分重要。为生成高质量文本,流行的解码算法如 top-k、top-p(nucleus)和基于温度的采样截断或扭曲语言模型不可靠的低概率尾部。尽管这些方法在参数调优后生成高质量文本,但它们是临时的。关于它们对输出统计量的控制所知甚少,而这很重要,因为近期报告显示文本质量在特定似然范围内最高。此处,首先我们对 top-k、top-p 和温度采样中的困惑度提供理论分析,发现基于 Zipf 统计,在 top-p 采样中交叉熵作为 p 的函数近似线性行为,而在 top-k 采样中它是 k 的非线性函数。我们利用该分析设计一种基于反馈的自适应 top-k 文本解码算法称为 mirostat,其生成具有预定困惑度值(任意长度)的文本,从而无需调优即生成高质量文本。实验显示,对于 top-k 和 top-p 采样中 k 和 p 的低值,困惑度随生成文本长度显著下降,这也与文本中过度重复(厌倦陷阱)相关。另一方面,对于 k 和 p 的大值,我们发现困惑度随生成文本长度增加,这与文本中不连贯(困惑陷阱)相关。Mirostat 避免两种陷阱:实验显示交叉熵与生成文本中重复近乎线性关系。该关系几乎与采样方法无关但略依赖于所用模型。因此,对于给定的语言模型,对困惑度的控制也给出对重复的控制。使用人类评分员对流畅性、连贯性和质量的实验进一步验证了我们的发现。

关键词

引用

@article{arxiv.2007.14966,
  title  = {Mirostat: A Neural Text Decoding Algorithm that Directly Controls Perplexity},
  author = {Sourya Basu and Govardana Sachitanandam Ramachandran and Nitish Shirish Keskar and Lav R. Varshney},
  journal= {arXiv preprint arXiv:2007.14966},
  year   = {2021}
}

备注

25 pages, 12 figures