直击梯度:学习使用新词元进行神经文本生成
计算与语言
2021-06-15 v1
摘要
先进的大规模神经语言模型在许多语言生成任务中取得了显著成功。然而,最常用的训练目标——最大似然估计(MLE)——已被证明存在问题,即训练后的模型偏好使用枯燥且重复的短语。在本工作中,我们提出 ScaleGrad,一种直接对损失函数梯度进行修改的方法,以补救标准 MLE 目标的退化问题。通过直接操控梯度信息,ScaleGrad 使模型学会使用新词元。实证结果表明,我们的方法不仅在开放域生成中有效,在定向生成任务中也同样有效。凭借架构的简洁性,我们的方法可作为一种通用的训练目标,适用于大多数神经文本生成任务。
引用
@article{arxiv.2106.07207,
title = {Straight to the Gradient: Learning to Use Novel Tokens for Neural Text Generation},
author = {Xiang Lin and Simeng Han and Shafiq Joty},
journal= {arXiv preprint arXiv:2106.07207},
year = {2021}
}
备注
ICML 2021