中文

FastQuery:面向私有LLM推理的高效嵌入表查询

密码学与安全 2024-05-28 v1 人工智能

摘要

随着大语言模型(LLM)的快速发展,关于用户查询的隐私问题日益突出,因为查询可能包含敏感信息。基于同态加密(HE)的私有推理已被提出以保护用户查询隐私。然而,私有嵌入表查询必须形式化为HE基于矩阵-向量乘法的问题,导致巨大的计算和通信开销。我们注意到开销主要来自:1)用户查询的独热特性被忽略,以及2)嵌入表对低位宽量化噪声具有鲁棒性。因此,本文提出了名为FastQuery的私有嵌入表查询优化框架。FastQuery具备面向通信的嵌入表量化算法和独热感知稠密打包算法,同时降低计算和通信成本。相较于现有HE框架(如Cheetah、Iron和Bumblebee),FastQuery在LLAMA-7B和LLAMA-30B模型上分别实现了超过 4.3×4.3\times2.7×2.7\times1.3×1.3\times 的延迟降低,以及超过 75.7×75.7\times60.2×60.2\times20.2×20.2\times 的通信降低。

关键词

引用

@article{arxiv.2405.16241,
  title  = {FastQuery: Communication-efficient Embedding Table Query for Private LLM Inference},
  author = {Chenqi Lin and Tianshi Xu and Zebin Yang and Runsheng Wang and Ru Huang and Meng Li},
  journal= {arXiv preprint arXiv:2405.16241},
  year   = {2024}
}

备注

6 pages, DAC2024