通过从万亿 tokens 中检索来改进语言模型
计算与语言
2022-02-09 v3 机器学习
摘要
我们通过基于与前文 tokens 的局部相似性,从大型语料库中检索文档块并以此为条件,增强了自回归语言模型。凭借 万亿 token 的数据库,我们的检索增强 Transformer (RETRO) 在 Pile 上的性能与 GPT-3 和 Jurassic-1 相当,尽管其使用的参数量减少了 25。经过微调后,RETRO 的性能可迁移至问答等下游知识密集型任务。RETRO 结合了冻结的 Bert 检索器、可微编码器以及分块交叉注意力机制,从而能够基于比训练期间通常消耗量多一个数量级的数据来预测 tokens。我们通常从头开始训练 RETRO,但也能快速对预训练 Transformer 进行 RETROfit 检索改造,并依然取得良好的性能。我们的工作通过前所未有的规模的显式记忆,为改进语言模型开辟了新途径。
引用
@article{arxiv.2112.04426,
title = {Improving language models by retrieving from trillions of tokens},
author = {Sebastian Borgeaud and Arthur Mensch and Jordan Hoffmann and Trevor Cai and Eliza Rutherford and Katie Millican and George van den Driessche and Jean-Baptiste Lespiau and Bogdan Damoc and Aidan Clark and Diego de Las Casas and Aurelia Guy and Jacob Menick and Roman Ring and Tom Hennigan and Saffron Huang and Loren Maggiore and Chris Jones and Albin Cassirer and Andy Brock and Michela Paganini and Geoffrey Irving and Oriol Vinyals and Simon Osindero and Karen Simonyan and Jack W. Rae and Erich Elsen and Laurent Sifre},
journal= {arXiv preprint arXiv:2112.04426},
year = {2022}
}
备注
Fix incorrect reported numbers in Table 14