克隆你无法窃取的模型:通过 Logit 泄露与蒸馏实现黑盒大语言模型复制
摘要
大语言模型 (LLMs) 越来越多地部署在关键任务系统中,用于辅助卫星操作、指挥控制、军事决策支持和网络防御等任务。其中许多系统通过应用程序编程接口 (API) 访问。当此类 API 缺乏严格的访问控制时,可能会暴露完整或 top-k logits,从而形成一个重大且常被忽视的攻击面。现有技术主要侧重于重构输出投影层或蒸馏表层行为。然而,在严格的查询约束下再生一个黑盒模型仍未得到充分探索。我们通过引入一个受约束的复制流程来填补这一空白,该流程将部分 logit 泄露转化为一个功能性的可部署替代模型克隆。我们的两阶段方法:(i) 通过对 logits 进行奇异值分解 (SVD),从不到 1 万次黑盒查询中收集 top-k logits,以此重构输出投影矩阵;(ii) 随后,将剩余架构蒸馏成具有不同 Transformer 深度的紧凑型学生模型,并在开源数据集上进行训练。一个 6 层学生模型重现了 6 层教师模型 97.6% 的隐藏状态几何结构,困惑度仅增加 7.31%,负对数似然 (NLL) 为 7.58。一个 4 层变体实现了 17.1% 的推理加速和 18.1% 的参数减少,且性能相当。整个攻击在 24 个图形处理单元 (GPU) 小时内完成,并避免了触发 API 速率限制防御。这些结果展示了成本受限的对手能以多快的速度克隆一个 LLM,凸显了强化推理 API 和部署安全本地防御的迫切需求。
引用
@article{arxiv.2509.00973,
title = {Clone What You Can't Steal: Black-Box LLM Replication via Logit Leakage and Distillation},
author = {Kanchon Gharami and Hansaka Aluvihare and Shafika Showkat Moni and Berker Peköz},
journal= {arXiv preprint arXiv:2509.00973},
year = {2025}
}
备注
8 pages. Accepted for publication in the proceedings of 7th IEEE International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (IEEE TPS 2025)