中文

基于移动目标防御和内容剥离与重构的零信任人工智能模型安全

密码学与安全 2025-03-04 v1 人工智能

摘要

本文考察了通过模型仓库和文件传输机制分发 AI 模型所面临的挑战。尽管安全措施取得了进展,但仍存漏洞, necessitating 采用多层次方法来有效缓解风险。模型文件的物理安全至关重要,需要严格的访问控制和攻击预防措施。本文提出了一种新型方案架构,包含两种预防措施:第一是内容剥离与重构(CDR),其 focuses on 剥离启用恶意代码的序列化攻击;第二是通过移动目标防御(MTD)来保护模型架构和权重免受攻击,通过改变模型结构并提供验证步骤来检测此类攻击。本文重点关注极易被利用的 Pickle 和 PyTorch 文件格式。在已知 AI 模型仓库和实际恶意软件攻击(如来自 HuggingFace 模型仓库的攻击)中验证后,本文实现了100%的剥离率。

关键词

引用

@article{arxiv.2503.01758,
  title  = {Zero-Trust Artificial Intelligence Model Security Based on Moving Target Defense and Content Disarm and Reconstruction},
  author = {Daniel Gilkarov and Ran Dubin},
  journal= {arXiv preprint arXiv:2503.01758},
  year   = {2025}
}