大语言模型最新后门攻击与防御综述
密码学与安全
2025-01-07 v5 人工智能
计算与语言
摘要
大语言模型(LLMs)通过人类语言理解与复杂问题解决之间的鸿沟,实现了在几类和零样例设置下在多个自然语言处理任务上取得最先进性能。尽管大语言模型效果显著,但由于计算资源限制,用户必须与开源语言模型交互或将整个训练过程外包给第三方平台。然而,研究表明语言模型对潜在安全漏洞高度敏感,尤其是后门攻击。后门攻击旨在通过污染训练样本或模型权重,向语言模型引入针对性漏洞,允许攻击者通过恶意触发器操控模型响应。虽然现有后门攻击综述提供了全面概述,但缺乏针对大语言模型的深入检视。为填补这一空白并把握领域最新趋势,本文提出了一种新视角,聚焦于大语言模型的后门攻击,特别关注微调方法。具体而言,我们系统地将后门攻击分为三类:全参数微调、参数高效微调和无微调。基于大量综述所得见解,我们还讨论了未来研究的关键问题,如进一步探索无需微调的攻击算法,或开发更隐蔽的攻击算法。
引用
@article{arxiv.2406.06852,
title = {A Survey of Recent Backdoor Attacks and Defenses in Large Language Models},
author = {Shuai Zhao and Meihuizi Jia and Zhongliang Guo and Leilei Gan and Xiaoyu Xu and Xiaobao Wu and Jie Fu and Yichao Feng and Fengjun Pan and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2406.06852},
year = {2025}
}
备注
Accepted in TMLR