NeuPerm:利用置换对称性扰乱神经网络参数中隐藏的恶意软件
密码学与安全
2025-10-24 v1
摘要
预训练的深度学习模型共享对研究人员和企业家都具有巨大价值。它允许他们以训练全新模型的低成本通过微调模型来应用深度学习。然而,模型共享会将终端用户暴露于利用模型进行恶意目的的网络威胁。攻击者可以利用模型共享,将自执行恶意软件隐藏在神经网络参数中,然后分发给毫无察觉的用户,以便他们不知不觉直接执行它们,或作为另一个软件的依赖项间接执行。在本工作中,我们提出了NeuPerm,这是一种简单而有效的方法,通过利用神经网络置换对称性的理论属性来扰乱此类恶意软件。我们的方法对模型性能几乎没有影响,我们经验性地展示它成功地扰乱了只有使用量化(一种高度复杂的过程)才能以前解决的前沿攻击。NeuPerm被证明在LLM上有效,此前没有任何其他类似的工作实现过。源代码可在 https://github.com/danigil/NeuPerm.git 获取。
引用
@article{arxiv.2510.20367,
title = {NeuPerm: Disrupting Malware Hidden in Neural Network Parameters by Leveraging Permutation Symmetry},
author = {Daniel Gilkarov and Ran Dubin},
journal= {arXiv preprint arXiv:2510.20367},
year = {2025}
}