中文

语言模型的当前局限:你需要的是检索

计算与语言 2020-09-16 v1 机器学习

摘要

我们对当前一些改善语言模型性能-计算权衡的方法进行分类并重新审视,包括(1)非因果模型(如掩码语言模型),(2)利用高效注意力扩展批长度,(3)循环,(4)条件计算以及(5)检索。我们指出了(1)—(4)所遭受的一些局限。例如,(1)目前在开放文本生成方面存在困难,其输出由输入松散约束,并且由于需要特定的微调数据集,难以像 GPT-2/3 那样执行通用文本任务。(2)和(3)不能改善前 103\sim 10^3 个词的预测。扩大模型规模(例如通过(4)高效实现)仍导致某些任务的性能扩展不佳。我们认为(5)将解决许多此类局限,并且它可以(a)减少监督量以及(b)高效地在整个训练数据集和当前样本的完整历史之上扩展上下文。我们推测如何修改 MARGE 以执行实现(b)的无监督因果建模,其中检索器联合训练。

关键词

引用

@article{arxiv.2009.06857,
  title  = {Current Limitations of Language Models: What You Need is Retrieval},
  author = {Aran Komatsuzaki},
  journal= {arXiv preprint arXiv:2009.06857},
  year   = {2020}
}