中文

激活函数致危害:通过受控信道恢复神经网络权重

密码学与安全 2025-10-06 v2 机器学习

摘要

随着高风险机器学习应用日益迁移至不可信任的终端或云端环境,保护预训练模型参数对保护知识产权和用户隐私至关重要。近期硬件隔离信任陷阱(如 Intel SGX)虽能确保即使在被破坏的操作系统下,机器学习应用的内部状态也能受到保护。然而,我们展示了特权软件敌人可利用常见神经网络激活函数中输入依赖的内存访问模式,从 SGX 信任陷阱中提取secret权重和偏置。我们的攻击利用 SGX-Step 框架获取噪声自由、指令粒度的页面访问轨迹。在一个包含 11 个输入的回归网络案例中使用 Tensorflow Microlite 库,我们演示了对第一层所有权重和偏置的完整恢复,以及在特定条件下对深层参数的部分恢复。该新型攻击技术仅需每权重 20 次查询即可获得所有第一层权重和偏置,平均绝对误差小于 1%,优于先前模型窃取攻击。此外,更广泛的生态系统分析揭示了在流行机器学习框架(直接或通过底层数学库)中广泛使用具有输入依赖内存访问模式的激活函数。我们的发现凸显了在 SGX 信任陷阱中部署保密模型的局限性,强调需要对机器学习实现进行更严格的侧信道验证,类似于对安全密码学库的审查。

关键词

引用

@article{arxiv.2503.19142,
  title  = {Activation Functions Considered Harmful: Recovering Neural Network Weights through Controlled Channels},
  author = {Jesse Spielman and David Oswald and Mark Ryan and Jo Van Bulck},
  journal= {arXiv preprint arXiv:2503.19142},
  year   = {2025}
}

备注

20 pages, 12 figures. Please cite this work as: Jesse Spielman, David Oswald, Mark Ryan, Jo Van Bulck, "Activation Functions Considered Harmful: Recovering Neural Network Weights through Controlled Channels" in Proceedings of the 28th International Symposium on Research in Attacks, Intrusions and Defenses (RAID), Gold Cost, Australia, October 2025