中文

模型 X 射线:基于少数样本学习检测 AI 模型权重中的隐藏恶意软件

密码学与安全 2024-10-01 v1 人工智能

摘要

随着人工智能(AI)的快速发展以及 Model Zoo 等平台在共享 AI 模型方面的广泛应用,滥用 AI 模型的潜力日益增加。攻击者可以通过干扰技术在 AI 模型中嵌入恶意软件,利用这些模型的巨大规模来隐藏恶意数据并用于恶意目的,例如远程代码执行。确保 AI 模型的安全正成为一个迫切的研究领域,对于维护依赖 AI 技术的众多组织和用户至关重要。本研究利用已广泛研究的图像少数样本学习技术,通过一种新颖的图像表示方法将 AI 模型转化为图像领域。应用少数样本学习可实现实际可用的模型,而前人工作缺乏这一能力。本方法解决了最新检测技术的关键局限性,这些技术限制了其实用性。该方法将所需训练数据集规模从 40000 个模型缩减至仅 6 个。此外,我们的方法能够一致检测嵌入率最高达 25% 的细微攻击,甚至在某些情况下达到 6%,而以往工作仅在 100%-50% 嵌入率下有效。我们采用严格的评估策略以确保训练模型在各种因素下具有通用性。此外,我们展示了训练好的模型成功检测新型扩频干扰攻击,仅通过学习一种攻击类型即可展现出惊人的鲁棒性。我们开源代码以支持可重复性并提升该新领域的研究。

关键词

引用

@article{arxiv.2409.19310,
  title  = {Model X-Ray: Detection of Hidden Malware in AI Model Weights using Few Shot Learning},
  author = {Daniel Gilkarov and Ran Dubin},
  journal= {arXiv preprint arXiv:2409.19310},
  year   = {2024}
}