中文

无 Softmax 层的高效上下文表示学习

计算与语言 2019-03-01 v1 机器学习

摘要

上下文表示模型在改进各种下游任务方面取得了巨大成功。然而,这些基于语言模型的编码器由于参数规模大、计算复杂度高而难以训练。通过仔细审视训练过程,我们发现 softmax 层(输出层)因词汇表规模庞大而导致显著的低效。因此,我们重新设计了学习目标,并提出了一种训练上下文表示模型的高效框架。具体而言,所提方法通过降维进行语言建模来绕过 softmax 层,并允许模型利用预训练词嵌入。我们的框架将输出层所耗费的时间降至可忽略水平,几乎消除了 softmax 层的所有可训练参数,并在不截断词汇表的情况下进行语言建模。当应用于 ELMo 时,我们的方法实现了 4 倍加速,消除了 80% 的可训练参数,同时在下游任务上取得了具有竞争力的性能。

关键词

引用

@article{arxiv.1902.11269,
  title  = {Efficient Contextual Representation Learning Without Softmax Layer},
  author = {Liunian Harold Li and Patrick H. Chen and Cho-Jui Hsieh and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:1902.11269},
  year   = {2019}
}

备注

Work in progress