中文

Cascade:Token 分片的隐私 LLM 推理

机器学习 2025-07-08 v1 密码学与安全

摘要

随着 LLM 参数规模持续增长,运行它们所需的计算资源只有少数方能够获得。因此,第三方推理服务——即由拥有大量计算资源的第三方托管 LLM——正变得越来越流行。然而,第三方推理引发了对用户数据隐私的关键担忧。为了降低这些风险,隐私研究人员开发了可证明安全的第三方推理方案,例如安全多方计算(SMPC)。但是,SMPC 协议具有显著的计算和通信开销,且无法扩展到大型模型。在这项工作中,我们提出了一种新的多方推理协议 Cascade,它通过利用序列维度的分片来维护隐私,从而避免了这些惩罚性成本,以加密隐私保证换取性能和可扩展性的提升。我们证明 Cascade 能够抵抗一种近期攻击的泛化形式(该攻击对其他统计隐私方案非常有效),并且还能进一步抵抗基于学习的攻击。由于 Cascade 比现有方案快几个数量级,我们的发现为现代 SOTA LLM 的安全部署提供了实用解决方案。

关键词

引用

@article{arxiv.2507.05228,
  title  = {Cascade: Token-Sharded Private LLM Inference},
  author = {Rahul Thomas and Louai Zahran and Erica Choi and Akilesh Potti and Micah Goldblum and Arka Pal},
  journal= {arXiv preprint arXiv:2507.05228},
  year   = {2025}
}

备注

To be published in ICML 2025 Main Proceedings as "Hidden No More: Attacking and Defending Private Third-Party LLM Inference", together with arXiv:2505.18332