中文

针对 AI 模型 LSB 攻击的隐写分析

密码学与安全 2024-05-09 v1

摘要

过去十年中,人工智能取得了显著进展,导致模型共享日益流行。model zoo 生态系统作为预训练 AI 模型的存储库,推动了 AI 开源社区的发展,也为网络风险开辟了新的途径。恶意攻击者可以利用共享模型发起网络攻击。本工作聚焦于对注入 AI 模型中的恶意最低有效位(Least Significant Bit, LSB)隐写术进行隐写分析,且是首个关注 AI 模型攻击的工作。针对此威胁,本文提出了一种专门定制的隐写分析方法,基于有监督和无监督的 AI 检测隐写分析方法,用于检测和缓解恶意 LSB 隐写攻击。我们提出的技术旨在维护共享模型的完整性、保护用户信任,并保持 AI 社区内开放协作的势头。本工作中,我们提出了 3 种隐写分析方法并开源了代码。我们发现隐写分析的成功与否取决于 LSB 攻击的位置。如果攻击者决定利用 LSB 中的最低有效位,则检测攻击的能力较低。然而,如果攻击位于最具显著性的 LSB 位,则几乎可以完美准确地检测到该攻击。

关键词

引用

@article{arxiv.2310.01969,
  title  = {Steganalysis of AI Models LSB Attacks},
  author = {Daniel Gilkarov and Ran Dubin},
  journal= {arXiv preprint arXiv:2310.01969},
  year   = {2024}
}