预计算记忆还是即时编码?检索增强的混合方法最大化利用计算资源
计算与语言
2023-06-06 v2 人工智能
机器学习
摘要
诸如Fusion-in-Decoder之类的检索增强语言模型功能强大,在多种知识密集型任务上树立了SOTA。然而,由于需要对大量检索到的段落进行编码,它们也十分昂贵。部分工作通过预先将文本语料编码为记忆并直接检索稠密表示来避免该成本。然而,预编码记忆会带来严重的质量损失,因为记忆表示并未以当前输入为条件。我们提出LUMEN,一种介于这两个极端之间的混合方法,预计算检索表示的大部分,并使用以问题为条件且针对任务微调的实时编码器即时完成编码。我们表明,LUMEN在多个问答任务上显著优于纯记忆方法,同时比FiD便宜得多,并且在任意给定计算预算下均优于二者。此外,LUMEN相对于FiD的优势随模型规模增大而增加。
引用
@article{arxiv.2301.10448,
title = {Pre-computed memory or on-the-fly encoding? A hybrid approach to retrieval augmentation makes the most of your compute},
author = {Michiel de Jong and Yury Zemlyanskiy and Nicholas FitzGerald and Joshua Ainslie and Sumit Sanghai and Fei Sha and William Cohen},
journal= {arXiv preprint arXiv:2301.10448},
year = {2023}
}
备注
ICML 2023