用于预训练语言模型的大型乘积键记忆
计算与语言
2020-10-09 v1
摘要
Lample等人(2019)提出的乘积键记忆(PKM)能够通过增加模型容量而几乎没有显著的计算开销来提高预测准确性。然而,他们的经验应用仅限于因果语言建模。受预训练语言模型(PLM)近期成功的启发,我们研究了如何将大型PKM集成到PLM中,这些PLM可以针对各种下游NLP任务进行微调。我们定义了一个新的内存使用度量,并使用该度量进行仔细观察,发现大多数内存槽在训练PKM增强模型期间仍然过时。为了解决这个问题以训练更好的PLM,我们提出了简单但有效的解决方案:(1)从没有记忆的预训练模型权重初始化;(2)通过加法而不是替换前馈网络来增强PKM。我们验证了这两者对于PKM增强PLM的预训练至关重要,提高了内存利用率和下游性能。代码和预训练权重可在https://github.com/clovaai/pkm-transformers获取。
引用
@article{arxiv.2010.03881,
title = {Large Product Key Memory for Pretrained Language Models},
author = {Gyuwan Kim and Tae-Hwan Jung},
journal= {arXiv preprint arXiv:2010.03881},
year = {2020}
}
备注
Accepted to Findings of EMNLP 2020; 10 pages, 4 figures