中文

哲人石:大语言模型插件的木马化

密码学与安全 2024-09-12 v3

摘要

开源大语言模型(LLM)近期因其可与专有 LLM 相媲美的性能而广受欢迎。为高效完成领域专门任务,开源 LLM 可在无需昂贵加速器的情况下使用低秩适配器进行精调。然而,低秩适配器是否可被利用来控制 LLM 仍属未知。为填补此空白,我们展示了受感染的适配器可在特定触发条件下诱导 LLM 输出由攻击者定义的内容,甚至恶意调用工具。为训练木马适配器,我们提出两种超越已有方法的新型攻击 POLISHED 与 FUSION。POLISHED 利用更优的 LLM 对我们提出的朴素投毒数据对齐,基于我们发现其在训练时能更好地注入投毒知识的洞察。相反,FUSION 利用一种新颖的过投毒流程,通过放大模型权重中触发词与目标间的注意力,将良性适配器转化为恶意适配器。在我们的实验中,我们首先进行两项案例研究,证明被攻陷的 LLM 智能体可使用恶意软件控制系统(如 LLM 驱动的机器人)或发起鱼叉式钓鱼攻击。随后,在定向误导信息方面,我们展示所提攻击比现有基线具有更高的攻击有效性,且为吸引下载,保持了或提升了适配器的效用。最后,我们设计并评估了三种潜在防御手段。然而,无一能完全有效抵御我们的攻击,凸显了支持安全 LLM 供应链的更鲁棒防御之必要。

关键词

引用

@article{arxiv.2312.00374,
  title  = {The Philosopher's Stone: Trojaning Plugins of Large Language Models},
  author = {Tian Dong and Minhui Xue and Guoxing Chen and Rayne Holland and Yan Meng and Shaofeng Li and Zhen Liu and Haojin Zhu},
  journal= {arXiv preprint arXiv:2312.00374},
  year   = {2024}
}

备注

Accepted by NDSS Symposium 2025. Please cite this paper as "Tian Dong, Minhui Xue, Guoxing Chen, Rayne Holland, Yan Meng, Shaofeng Li, Zhen Liu, Haojin Zhu. The Philosopher's Stone: Trojaning Plugins of Large Language Models. In the 32nd Annual Network and Distributed System Security Symposium (NDSS 2025)."