大规模安全:大模型与智能体安全综合综述
密码学与安全
2026-04-15 v6 人工智能
计算与语言
计算机视觉与模式识别
摘要
大模型凭借其通过大规模预训练获得的卓越学习与泛化能力而迅速发展,重塑了人工智能(AI)的格局。这些模型现已成为对话式AI、推荐系统、自动驾驶、内容生成、医疗诊断和科学发现等广泛应用的基础。然而,它们的广泛部署也使其面临重大的安全风险,引发了对其鲁棒性、可靠性和伦理影响的担忧。本综述系统回顾了当前大模型的安全研究,涵盖视觉基础模型(VFMs)、大语言模型(LLMs)、视觉-语言预训练(VLP)模型、视觉-语言模型(VLMs)、扩散模型(DMs)以及由大模型驱动的智能体。我们的贡献总结如下:(1)我们提出了一个针对这些模型安全威胁的全面分类法,包括对抗攻击、数据投毒、后门攻击、越狱与提示注入攻击、能量-延迟攻击、数据与模型提取攻击,以及新兴的智能体特有威胁。(2)我们回顾了针对各类攻击(如有)提出的防御策略,并总结了安全研究中常用的数据集和基准。(3)在此基础上,我们识别并讨论了大模型安全中的开放性挑战,强调了对全面安全评估、可扩展且有效的防御机制以及可持续数据实践的需求。更重要的是,我们强调了研究界集体努力和国际合作的必要性。我们的工作可作为研究人员和从业者的有用参考,促进综合防御系统和平台的持续发展,以保障AI模型的安全。
引用
@article{arxiv.2502.05206,
title = {Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety},
author = {Xingjun Ma and Yifeng Gao and Yixu Wang and Ruofan Wang and Xin Wang and Ye Sun and Yifan Ding and Hengyuan Xu and Yunhao Chen and Yunhan Zhao and Hanxun Huang and Yige Li and Yutao Wu and Jiaming Zhang and Xiang Zheng and Yang Bai and Zuxuan Wu and Xipeng Qiu and Jingfeng Zhang and Yiming Li and Xudong Han and Haonan Li and Jun Sun and Cong Wang and Jindong Gu and Baoyuan Wu and Siheng Chen and Tianwei Zhang and Yang Liu and Mingming Gong and Tongliang Liu and Shirui Pan and Cihang Xie and Tianyu Pang and Yinpeng Dong and Ruoxi Jia and Yang Zhang and Shiqing Ma and Xiangyu Zhang and Neil Gong and Chaowei Xiao and Sarah Erfani and Tim Baldwin and Bo Li and Masashi Sugiyama and Dacheng Tao and James Bailey and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2502.05206},
year = {2026}
}
备注
706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety