中文

LLM(-Agent)全栈安全综述:数据、训练与部署

密码学与安全 2025-06-10 v4 人工智能 计算与语言 机器学习

摘要

大型语言模型(Large Language Models,LLMs)的显著成功为学术界和产业界实现人工通用智能(Artificial General Intelligence)提供了一条有前景的道路,由于其在各种应用场景中的非凡性能。随着LLMs在研究和商业领域的日益流行,其安全性和可靠性问题正成为研究人员、企业乃至各国普遍关心的焦点。目前,现有的LLM安全 surveys 主要集中在LLM生命周期的特定阶段,例如部署阶段或微调阶段,缺乏对整个LLM“生命周期”全面理解的视角。为弥合这一差距,本文首次提出“全栈安全”(full-stack safety)概念,系统性地考虑LLM训练、部署及最终商业化整个过程中的安全问题。与现有的即插即用LLM安全 surveys 相比,本文展现了几个独特的优势:(I)全面视角。我们将LLM生命周期定义为包括数据准备、预训练、后训练、部署和最终商业化。迄今为止,这是第一篇涵盖LLMs整个生命周期的安全调查。(II)大量文献支撑。我们的研究基于对800多篇论文的详尽综述,确保了对更为整体性理解下安全问题的全面覆盖和系统组织。(III)独特洞见。通过系统的文献分析,我们为每个章节发展出可靠的路线图和视角。我们的工作识别出包括数据生成中的安全性、对齐技术、模型编辑以及基于LLM的智能体系统等在内的有前景的研究方向。这些见解为追求该领域未来工作的研究人员提供了有价值的指导。

关键词

引用

@article{arxiv.2504.15585,
  title  = {A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment},
  author = {Kun Wang and Guibin Zhang and Zhenhong Zhou and Jiahao Wu and Miao Yu and Shiqian Zhao and Chenlong Yin and Jinhu Fu and Yibo Yan and Hanjun Luo and Liang Lin and Zhihao Xu and Haolang Lu and Xinye Cao and Xinyun Zhou and Weifei Jin and Fanci Meng and Shicheng Xu and Junyuan Mao and Yu Wang and Hao Wu and Minghe Wang and Fan Zhang and Junfeng Fang and Wenjie Qu and Yue Liu and Chengwei Liu and Yifan Zhang and Qiankun Li and Chongye Guo and Yalan Qin and Zhaoxin Fan and Kai Wang and Yi Ding and Donghai Hong and Jiaming Ji and Yingxin Lai and Zitong Yu and Xinfeng Li and Yifan Jiang and Yanhui Li and Xinyu Deng and Junlin Wu and Dongxia Wang and Yihao Huang and Yufei Guo and Jen-tse Huang and Qiufeng Wang and Xiaolong Jin and Wenxuan Wang and Dongrui Liu and Yanwei Yue and Wenke Huang and Guancheng Wan and Heng Chang and Tianlin Li and Yi Yu and Chenghao Li and Jiawei Li and Lei Bai and Jie Zhang and Qing Guo and Jingyi Wang and Tianlong Chen and Joey Tianyi Zhou and Xiaojun Jia and Weisong Sun and Cong Wu and Jing Chen and Xuming Hu and Yiming Li and Xiao Wang and Ningyu Zhang and Luu Anh Tuan and Guowen Xu and Jiaheng Zhang and Tianwei Zhang and Xingjun Ma and Jindong Gu and Liang Pang and Xiang Wang and Bo An and Jun Sun and Mohit Bansal and Shirui Pan and Lingjuan Lyu and Yuval Elovici and Bhavya Kailkhura and Yaodong Yang and Hongwei Li and Wenyuan Xu and Yizhou Sun and Wei Wang and Qing Li and Ke Tang and Yu-Gang Jiang and Felix Juefei-Xu and Hui Xiong and Xiaofeng Wang and Dacheng Tao and Philip S. Yu and Qingsong Wen and Yang Liu},
  journal= {arXiv preprint arXiv:2504.15585},
  year   = {2025}
}