基于Transformer的语言模型
计算与语言
2019-10-18 v2 人工智能
机器学习
摘要
Transformer架构在计算效率上优于基于RNN的模型。近来,GPT和BERT通过在大规模语料上预训练语言模型,展示了Transformer模型在各种NLP任务上的有效性。令人惊讶的是,这些Transformer架构对于语言模型本身而言并非最优。Transformer中的自注意力与位置编码均无法高效融入对语言建模至关重要的词级序列上下文。本文探索用于语言模型的有效Transformer架构,包括添加额外的LSTM层以更好地捕获序列上下文,同时仍保持计算高效。我们提出坐标架构搜索(CAS)通过模型的迭代精化来发现有效架构。在PTB、WikiText-2和WikiText-103上的实验结果表明,CAS在所有问题上取得20.42至34.11的困惑度,即相较于最先进LSTM平均提升12.0个困惑度单位。源代码已公开可用。
引用
@article{arxiv.1904.09408,
title = {Language Models with Transformers},
author = {Chenguang Wang and Mu Li and Alexander J. Smola},
journal= {arXiv preprint arXiv:1904.09408},
year = {2019}
}
备注
12 pages, 7 tables, 4 figures