中文

最近邻语言模型的正则化训练

计算与语言 2021-09-20 v1

摘要

在自然语言处理架构中引入记忆库,可通过在推理时提供额外数据来提升模型容量。本文在 kkNN-LM \citep{khandelwal20generalization} 的基础上展开研究,该模型使用预训练语言模型并结合对训练数据(记忆库)的穷举式 kkNN 搜索,取得了最先进的结果。我们探究是否可以通过训练一个已知后续将使用 kkNN 事后检索的语言模型来提升 kkNN-LM 的性能。在 \texttt{WIKI-2} 和 \texttt{WIKI-103} 的语言建模任务上,我们的方法取得了显著改进。我们遇到的主要现象是:对模型(一个 transformer)的激活值(而非权重)添加简单的 L2 正则化,可改善事后 kkNN 分类性能。我们探讨了造成这一改进的一些可能原因。特别地,我们发现所添加的 L2 正则化似乎能在不损害低频词性能的前提下,提升高频词的性能。

关键词

引用

@article{arxiv.2109.08249,
  title  = {Regularized Training of Nearest Neighbor Language Models},
  author = {Jean-Francois Ton and Walter Talbott and Shuangfei Zhai and Josh Susskind},
  journal= {arXiv preprint arXiv:2109.08249},
  year   = {2021}
}