揭开神经文本退化的奇特案例
计算与语言
2023-10-04 v1
摘要
尽管截断采样启发式(如核采样)在语言生成中无处不在,其为何如此有效仍属未知。我们为截断采样的有效性提供了理论解释,证明丢弃低于某概率阈值(最常见的截断类型)的 token 的截断方法,能保证所有被采样 token 具有非零真实概率。然而,阈值是粗略启发式,必然也丢弃了一些具有非零真实概率的 token。为追求更精确的采样策略,我们表明可利用已知模型误差来源——softmax 瓶颈——来证明某些 token 具有非零真实概率,而无需依赖阈值。基于我们的发现,我们开发了实验性截断策略,并给出初步研究以展示此类算法的潜力。我们的评估表明,在自动与人工评价指标下,对于低熵(即接近贪婪)的开放式文本生成,该方法优于基于阈值的对应方法。我们的理论发现与初步实验既增进了对截断采样为何有效的理解,也推动了更具表现力的采样算法发展,以更好展现大型语言模型的生成能力。
引用
@article{arxiv.2310.01693,
title = {Closing the Curious Case of Neural Text Degeneration},
author = {Matthew Finlayson and John Hewitt and Alexander Koller and Swabha Swayamdipta and Ashish Sabharwal},
journal= {arXiv preprint arXiv:2310.01693},
year = {2023}
}