重复入重复出:从数据视角理解神经文本退化
计算与语言
2023-10-17 v1
摘要
关于神经文本退化问题(即生成重复而枯燥的循环)存在多种分歧的假说,这使该问题既有趣又令人困惑。本工作中,我们旨在从数据视角给出一个直白而基础的解释,以增进理解。我们的初步调查揭示了退化问题与训练数据中重复现象之间的强相关性。后续实验也表明,通过在训练数据中选择性丢弃对重复词的注意力,可显著缓解退化。此外,我们的实证分析说明,先前从各异角度(如高流入词、似然目标与自强化现象)解决退化问题的工作,均可由一种简单解释诠释:即对训练数据中重复的惩罚是其生效的共同且基础的因素。而且,我们的实验揭示,即便考虑更大模型规模与指令微调,惩罚训练数据中的重复依旧关键。
引用
@article{arxiv.2310.10226,
title = {Repetition In Repetition Out: Towards Understanding Neural Text Degeneration from the Data Perspective},
author = {Huayang Li and Tian Lan and Zihao Fu and Deng Cai and Lemao Liu and Nigel Collier and Taro Watanabe and Yixuan Su},
journal= {arXiv preprint arXiv:2310.10226},
year = {2023}
}
备注
Accepted to NeurIPS 2023