文本生成模型中输入输出共享嵌入的归一化
计算与语言
2020-01-27 v2 机器学习
摘要
基于神经网络的模型已成为各种自然语言处理任务的最先进模型,然而网络中的输入输出维度问题仍未完全解决,尤其在文本生成任务(如机器翻译、文本摘要)中,输入输出均具有庞大的词表规模。因此,输入输出嵌入权重共享被引入并广泛采用,但其仍有改进空间。基于线性代数与统计理论,本文定位了现有输入输出嵌入权重共享方法的缺陷,进而提出改进输入输出权重共享嵌入的方法,其中嵌入权重矩阵归一化方法表现最佳。这些方法几乎不增加计算成本,可与其他嵌入技术结合,并在最先进的神经网络模型上展现出良好效果。对于Transformer-big模型,相较于原模型,归一化技术在WMT'16 En-De数据集上最多带来0.6 BLEU的提升,在IWSLT 14'数据集上也有类似的BLEU提升。对于DynamicConv模型,在WMT'16 En-De数据集上可获得0.5 BLEU提升,在IWSLT 14' De-En翻译任务上实现了0.41 BLEU提升。
引用
@article{arxiv.2001.07885,
title = {Normalization of Input-output Shared Embeddings in Text Generation Models},
author = {Jinyang Liu and Yujia Zhai and Zizhong Chen},
journal= {arXiv preprint arXiv:2001.07885},
year = {2020}
}