无 Softmax 层的高效上下文表示学习
计算与语言
2019-03-01 v1 机器学习
摘要
上下文表示模型在改进各种下游任务方面取得了巨大成功。然而,这些基于语言模型的编码器由于参数规模大、计算复杂度高而难以训练。通过仔细审视训练过程,我们发现 softmax 层(输出层)因词汇表规模庞大而导致显著的低效。因此,我们重新设计了学习目标,并提出了一种训练上下文表示模型的高效框架。具体而言,所提方法通过降维进行语言建模来绕过 softmax 层,并允许模型利用预训练词嵌入。我们的框架将输出层所耗费的时间降至可忽略水平,几乎消除了 softmax 层的所有可训练参数,并在不截断词汇表的情况下进行语言建模。当应用于 ELMo 时,我们的方法实现了 4 倍加速,消除了 80% 的可训练参数,同时在下游任务上取得了具有竞争力的性能。
引用
@article{arxiv.1902.11269,
title = {Efficient Contextual Representation Learning Without Softmax Layer},
author = {Liunian Harold Li and Patrick H. Chen and Cho-Jui Hsieh and Kai-Wei Chang},
journal= {arXiv preprint arXiv:1902.11269},
year = {2019}
}
备注
Work in progress