中文

用于训练具连续输出的序列到序列模型的 von Mises-Fisher 损失

计算与语言 2019-03-25 v3 机器学习 机器学习

摘要

Softmax 函数被用于几乎所有现有用于语言生成的序列到序列模型的最终层。然而,它通常是计算最慢的一层,这限制了词表大小为最常见词型的子集;并且它有较大的内存占用。我们提出一种用连续嵌入层替换 softmax 层的通用技术。我们的主要创新是一种新颖的概率损失,以及一种训练和推断流程,其中我们生成关于预训练词嵌入的概率分布,而不是通过 softmax 获得的关于词表的多项分布。我们在神经机器翻译任务上评估了这类具连续输出的序列到序列新模型。我们表明,我们的模型在训练时间上获得了高达 2.5 倍的加速,同时在翻译质量方面与最先进模型相当。这些模型能够处理非常大的词表而不牺牲翻译质量。它们还比基于 softmax 的模型产生更有意义的错误,因为这些错误通常位于参考翻译向量空间的一个子空间中。

关键词

引用

@article{arxiv.1812.04616,
  title  = {Von Mises-Fisher Loss for Training Sequence to Sequence Models with Continuous Outputs},
  author = {Sachin Kumar and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:1812.04616},
  year   = {2019}
}

备注

Seventh International Conference on Learning Representations (ICLR 2019)