SECNEURON:基于混合神经元加密实现本地 LLM 可靠且灵活的滥用控制
密码学与安全
2025-06-06 v1
摘要
拥有多样能力的大语言模型(LLM)正日益被部署到本地环境,带来显著的安全与可控性挑战。这些在本地部署的 LLM 超出开发者直接控制的范围,更易受滥用威胁。现有的缓解措施主要为云端 LLM 服务设计,频繁被规避或在受部署者控制的环境中无效。我们提出 SECNEURON,首个无缝嵌入 LLM 内在能力的框架,实现对本地部署 LLM 的可靠、低成本、灵活且可认证的滥用控制。SECNEURON 采用神经元级加密和选择性解密,动态控制 LLM 的任务特定能力,限制未授权任务滥用而不影响其他能力。我们首先设计任务特定神经元提取机制,以解耦逻辑相关神经元并构建用于处理耦合神经元的分层策略树。随后我们引入一种针对数百万神经元的灵活高效混合加密框架。最后,我们开发了基于分布的解密神经元检测机制,用于确保部分解密 LLM 的有效性。我们证明了 SECNEURON 在任务可控性原则下满足 IND-CPA 安全性和 collusion 抗性安全性。实验在各种任务设置下表明,SECNEURON 将未授权任务准确率限制在 25% 以下,同时保持授权准确率损失不足 2%。以未授权 Code 任务为例,滥用相关恶意代码生成准确率从 59% 降至 15%。SECNEURON 还能减缓未授权数据泄露,将 PII 提取率降至 5% 以下,将成员推断降至随机猜测水平。
引用
@article{arxiv.2506.05242,
title = {SECNEURON: Reliable and Flexible Abuse Control in Local LLMs via Hybrid Neuron Encryption},
author = {Zhiqiang Wang and Haohua Du and Junyang Wang and Haifeng Sun and Kaiwen Guo and Haikuo Yu and Chao Liu and Xiang-Yang Li},
journal= {arXiv preprint arXiv:2506.05242},
year = {2025}
}