文本生成中重复问题的理论分析
计算与语言
2021-03-23 v4
摘要
包括翻译、摘要、语言模型等在内的文本生成任务近年来快速增长。尽管取得了显著成就,重复问题已在几乎所有文本生成模型中被观察到,广泛损害了生成性能。为解决重复问题,已提出许多方法,但尚无现有理论分析表明该问题为何发生以及如何被解决。本文提出一个新的重复问题理论分析框架。我们首先定义平均重复概率(Average Repetition Probability, ARP)以定量刻画重复问题。然后,我们对马尔可夫生成模型进行广泛分析,并推导出平均重复概率的若干上界及直观理解。我们表明大多数现有方法本质上是在显式或隐式地最小化这些上界。基于我们的理论,我们表明重复问题不幸地是由语言自身的特性引起的。一个主要原因归于存在过多以高概率预测同一词作为后续词的词。因此,很容易回到该词并形成重复,我们称之为高流入问题。此外,我们推导了一般生成模型的平均重复概率的集中界。最后,基于理论上界,我们提出一种新颖的再平衡编码方法来缓解高流入问题。实验结果表明,我们的理论框架适用于一般生成模型,且我们提出的再平衡编码方法显著缓解了重复问题。本文源代码可从 https://github.com/fuzihaofzh/repetition-problem-nlg 获取。
引用
@article{arxiv.2012.14660,
title = {A Theoretical Analysis of the Repetition Problem in Text Generation},
author = {Zihao Fu and Wai Lam and Anthony Man-Cho So and Bei Shi},
journal= {arXiv preprint arXiv:2012.14660},
year = {2021}
}
备注
AAAI 21 Paper with Appendix