中文

利用推测加速检索增强大语言模型服务

机器学习 2024-01-26 v1 计算与语言 信息检索

摘要

检索增强大语言模型(RaLM)通过将非参数知识库与参数化语言模型相结合,已展现出解决知识密集型自然语言处理(NLP)任务的潜力。与微调全参数模型不同,RaLM的优势在于其低成本适应最新数据的能力和更好的来源归因机制。在众多RaLM方法中,迭代式RaLM由于检索器与语言模型之间更频繁的交互,能提供更好的生成质量。尽管有这些优点,迭代式RaLM通常因频繁的检索步骤而遭遇高昂的开销。为此,我们提出了RaLMSpec,一个受推测执行启发的框架,它通过推测性检索和批量验证,在保持相同模型输出的同时,为迭代式RaLM提供通用的加速。通过进一步结合预取、最优推测步长调度器和异步验证,RaLMSpec能够自动最大化地利用加速潜力。对于朴素的迭代式RaLM服务,在四个下游问答数据集上对三个语言模型的广泛评估表明,当检索器分别为精确密集检索器、近似密集检索器和稀疏检索器时,与基线相比,RaLMSpec分别能实现1.75-2.39倍、1.04-1.39倍和1.31-1.77倍的加速比。对于KNN-LM服务,当检索器分别为精确密集检索器和近似密集检索器时,与基线相比,RaLMSpec分别能实现高达7.59倍和2.45倍的加速比。

关键词

引用

@article{arxiv.2401.14021,
  title  = {Accelerating Retrieval-Augmented Language Model Serving with Speculation},
  author = {Zhihao Zhang and Alan Zhu and Lijie Yang and Yihua Xu and Lanting Li and Phitchaya Mangpo Phothilimthana and Zhihao Jia},
  journal= {arXiv preprint arXiv:2401.14021},
  year   = {2024}
}

备注

Preprint