FastQuery:面向私有LLM推理的高效嵌入表查询
密码学与安全
2024-05-28 v1 人工智能
摘要
随着大语言模型(LLM)的快速发展,关于用户查询的隐私问题日益突出,因为查询可能包含敏感信息。基于同态加密(HE)的私有推理已被提出以保护用户查询隐私。然而,私有嵌入表查询必须形式化为HE基于矩阵-向量乘法的问题,导致巨大的计算和通信开销。我们注意到开销主要来自:1)用户查询的独热特性被忽略,以及2)嵌入表对低位宽量化噪声具有鲁棒性。因此,本文提出了名为FastQuery的私有嵌入表查询优化框架。FastQuery具备面向通信的嵌入表量化算法和独热感知稠密打包算法,同时降低计算和通信成本。相较于现有HE框架(如Cheetah、Iron和Bumblebee),FastQuery在LLAMA-7B和LLAMA-30B模型上分别实现了超过 、、 的延迟降低,以及超过 、、 的通信降低。
引用
@article{arxiv.2405.16241,
title = {FastQuery: Communication-efficient Embedding Table Query for Private LLM Inference},
author = {Chenqi Lin and Tianshi Xu and Zebin Yang and Runsheng Wang and Ru Huang and Meng Li},
journal= {arXiv preprint arXiv:2405.16241},
year = {2024}
}
备注
6 pages, DAC2024