暴露偏差 versus 自恢复:自回归文本生成的失真真的是累积性的吗?
机器学习
2021-09-06 v9 计算与语言
机器学习
摘要
暴露偏差(exposure bias)一直被视为自回归语言模型(LM)的核心问题。该观点认为,教师强制(teacher forcing)会因训练—生成差异而导致测试时的生成逐步失真。尽管已有大量算法被提出以避免教师强制从而缓解暴露偏差,但鲜有工作揭示暴露偏差问题的实际严重程度。本文聚焦于开放式语言生成任务,提出从质量、多样性和一致性三个方面量化暴露偏差影响的指标。我们的核心直觉是:若将真实数据前缀(而非模型自身生成的前缀)输入模型并让其续写,由于前缀中的训练—生成差异被消除,生成性能应大幅提升。我们在实验中进行了自动与人工评估。与流行的暴露偏差认知相反,我们发现由前缀差异引起的失真有限,且在生成过程中似乎并非累积性的。此外,我们的分析揭示了 LM 一种有趣的自恢复能力,我们推测其正在抵消暴露偏差的有害影响。
引用
@article{arxiv.1905.10617,
title = {Exposure Bias versus Self-Recovery: Are Distortions Really Incremental for Autoregressive Text Generation?},
author = {Tianxing He and Jingzhao Zhang and Zhiming Zhou and James Glass},
journal= {arXiv preprint arXiv:1905.10617},
year = {2021}
}