中文

LoRATK:一次LoRA,后门遍布共享即玩生态系统

密码学与安全 2025-05-02 v2 人工智能 计算与语言

摘要

使用LoRA微调大语言模型因其简单性和有效性而广受欢迎。用户甚至常可获取可插拔的社区共享LoRA来增强其基础模型以完成特定下游任务,以极低投入享受强大、高效且定制化的LLM体验。然而,这种便捷的共享即玩生态系统也引入了新的攻击面,攻击者可向渴望尝试共享资产的社区分发恶意LoRA。尽管风险极高,但此前尚无研究全面探索LoRA在下游增强型共享即玩场景下的攻击面。本文研究了如何将后门注入任务增强型LoRA,并考察了此类感染的机制。我们发现,通过一种简单、高效且特定的配方,可以训练一个后门LoRA一次,然后无缝地(以无需训练的方式)与多个任务增强型LoRA合并,同时保留其恶意后门和良性下游能力。这使得攻击者能够利用现有丰富的共享LoRA资产,以最小努力大规模分发被感染的LoRA。我们注意到,此类合并后的LoRA尤其具有传染性——因为其恶意意图被巧妙地隐藏在改进的下游能力背后,从而强烈激励用户自愿下载——并且危险——因为在本地部署下,当出现问题时没有任何安全措施进行干预。我们的工作是首批研究这种无需训练即可分发具备下游能力且注入后门的LoRA的新威胁模型之一,凸显了LoRA生态系统中迫切需要提高安全意识的紧迫性。警告:本文包含冒犯性内容并涉及真实悲剧。

关键词

引用

@article{arxiv.2403.00108,
  title  = {LoRATK: LoRA Once, Backdoor Everywhere in the Share-and-Play Ecosystem},
  author = {Hongyi Liu and Shaochen Zhong and Xintong Sun and Minghao Tian and Mohsen Hariri and Zirui Liu and Ruixiang Tang and Zhimeng Jiang and Jiayi Yuan and Yu-Neng Chuang and Li Li and Soo-Hyun Choi and Rui Chen and Vipin Chaudhary and Xia Hu},
  journal= {arXiv preprint arXiv:2403.00108},
  year   = {2025}
}