ObfuscaTune:专有 LLM 在私有数据集上的隐式化离线微调与推理
密码学与安全
2025-01-14 v2 人工智能
计算与语言
机器学习
摘要
本工作解决了一个紧迫且鲜有人关注的问题:在确保模型和数据保密性的前提下,在由数据所有者实体保密/私有数据的计算设施上,对由模型提供者实体拥有的专有 LLM 进行推理和微调。在这种情况下,微调是在第三方云提供商的计算设施上进行的。我们通过提出一种新颖、高效且完全保持实用性的 ObfuscaTune 方法来解决该问题,该方法将一种简单而有效的隐式化技术与对保密计算的高效使用相结合(仅将 5% 的模型参数置于 TEE)。我们通过在四个 NLP 基准数据集上对不同规模的 GPT-2 模型进行实验,实证证明了 ObfuscaTune 的有效性。最后,我们与本方法的一种天真版本进行比较,以突出使用条件数低的随机矩阵是必要的,以减少由隐式化引起的误差。
引用
@article{arxiv.2407.02960,
title = {ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets},
author = {Ahmed Frikha and Nassim Walha and Ricardo Mendes and Krishna Kanth Nakka and Xue Jiang and Xuebing Zhou},
journal= {arXiv preprint arXiv:2407.02960},
year = {2025}
}
备注
Accepted at AAAI 2025 (PPAI Workshop)