面向基础模型时代的人工智能安全:一个统一视角下的综合调查
密码学与安全
2026-03-27 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
随着机器学习(ML)系统在规模和功能方面的扩张,安全领域日益复杂,攻击与防御的数量呈指数级增长。然而,现有研究大多将这些威胁孤立地加以处理,缺乏一种连贯的框架来暴露其共享原则和相互关联性。这种碎片化的视角阻碍了系统性理解,并限制了全面防御设计。关键在于,机器学习的两大基础资产——数据和模型——不再是独立的;其中一个的漏洞会直接威胁另一个。缺乏整体框架留下了关于这些双向风险如何在机器学习管道中传播的悬而未决问题。为缓解此关键性空白,我们提出一种统一的闭环威胁分类法,明确地将模型与数据交互沿四个方向轴线进行框架化。我们的框架为分析和防御基础模型提供了原则性视角。所提出的四类安全威胁代表了具有不同但相互关联性的攻击类别:(1)数据→数据(D→D):包括数据解密攻击和水印移除攻击;(2)数据→模型(D→M):包括投毒、有害微调攻击和越狱攻击;(3)模型→数据(M→D):包括模型逆向、成员推断攻击和训练数据提取攻击;(4)模型→模型(M→M):包括模型提取攻击。我们的统一框架阐明了这些安全威胁之间的底层联系,为开发可扩展、可迁移和跨模态的安全策略,特别是在基础模型的格局中奠定了基础。
引用
@article{arxiv.2603.24857,
title = {AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective},
author = {Zhenyi Wang and Siyu Luan},
journal= {arXiv preprint arXiv:2603.24857},
year = {2026}
}
备注
Published at Transactions on Machine Learning Research (TMLR)