最小化MPC的安全LLM推理
密码学与安全
2024-08-08 v1 人工智能
机器学习
摘要
许多基于大语言模型(LLM)的推理服务存在隐私问题,既会泄露用户提示信息给服务方,又会暴露模型的专有权重给用户。安全推理通过安全多方计算(Secure Multi-party Computation, MPC)提供了解决方案,但由于MPC带来的大额开销,仍不实用于现代LLM工作负载。为此,我们提出Marill框架,将LLM微调适应以最小化安全推理期间的MPC使用。Marill在微调中引入高层架构变更,显著减少推理期间在MPC中执行的昂贵操作,通过移除部分操作并将其他操作迁移到MPC之外而不牺牲安全性。结果是,Marill生成的模型在所有安全推理协议下都更高效,Our方法补充了此类操作的MPC友好近似。相较于标准微调,Marill在各种MPC设置下实现3.6-11.3倍更好的运行时性能和2.4-6.9倍更好的通信性能,同时通常保持超过90%的下游任务性能。
引用
@article{arxiv.2408.03561,
title = {MPC-Minimized Secure LLM Inference},
author = {Deevashwer Rathee and Dacheng Li and Ion Stoica and Hao Zhang and Raluca Popa},
journal= {arXiv preprint arXiv:2408.03561},
year = {2024}
}