最近邻语言模型的正则化训练
计算与语言
2021-09-20 v1
摘要
在自然语言处理架构中引入记忆库,可通过在推理时提供额外数据来提升模型容量。本文在 NN-LM \citep{khandelwal20generalization} 的基础上展开研究,该模型使用预训练语言模型并结合对训练数据(记忆库)的穷举式 NN 搜索,取得了最先进的结果。我们探究是否可以通过训练一个已知后续将使用 NN 事后检索的语言模型来提升 NN-LM 的性能。在 \texttt{WIKI-2} 和 \texttt{WIKI-103} 的语言建模任务上,我们的方法取得了显著改进。我们遇到的主要现象是:对模型(一个 transformer)的激活值(而非权重)添加简单的 L2 正则化,可改善事后 NN 分类性能。我们探讨了造成这一改进的一些可能原因。特别地,我们发现所添加的 L2 正则化似乎能在不损害低频词性能的前提下,提升高频词的性能。
引用
@article{arxiv.2109.08249,
title = {Regularized Training of Nearest Neighbor Language Models},
author = {Jean-Francois Ton and Walter Talbott and Shuangfei Zhai and Josh Susskind},
journal= {arXiv preprint arXiv:2109.08249},
year = {2021}
}