现代神经网络的微调完整性:基于范数、秩和稀疏性证书的结构漂移证明
密码学与安全
2026-04-07 v1 机器学习
摘要
微调已成为适应大型神经网络的主要方法,但也带来了新的完整性风险。不可信的第三方可在声称仅进行小幅更新的同时插入后门、改变安全行为或覆盖模型的大部分内容。现有验证工具关注推理正确性或完整模型源头追溯,未能解决此问题。我们提出微调完整性(Fine-Tuning Integrity, FTI)作为受控模型演化的安全目标。FTI 系统认证微调后的模型与受信任的基础模型仅在策略定义的漂移类别内发生差异。我们提出简明模型差分证明(Succinct Model Difference Proofs, SMDPs)作为一种新的密码学原语,用于强制执行这些漂移约束。SMDP 提供更新模型在范数受限、低秩或稀疏的零知识证明。验证者的计算成本仅取决于漂移的结构,而非模型的规模。我们给出基于随机投影、多项式承诺和流式线性检查的具体 SMDP 构造。我们还证明了信息论下界,表明某种形式的结构是实现简洁证明的必要条件。最后,我们为 transformer、CNN 和 MLP 提出了感知架构的实现方案,并构建了一个汇聚块级证明以形成全局证书的端到端系统。
引用
@article{arxiv.2604.04738,
title = {Fine-Tuning Integrity for Modern Neural Networks: Structured Drift Proofs via Norm, Rank, and Sparsity Certificates},
author = {Zhenhang Shang and Kani Chen},
journal= {arXiv preprint arXiv:2604.04738},
year = {2026}
}
备注
15 pages, 3 figures