中文

面向开源 LoRA 模型的因果引导式 Detoxify 后门攻击

密码学与安全 2025-12-23 v1 人工智能

摘要

低秩适配(Low-Rank Adaptation, LoRA)已成为微调大型语言模型(LLM)的高效方法,广泛应用于开源社区。然而,LoRA 适配器通过诸如 Hugging Face 等平台进行去中心化分发,引入了新的安全漏洞:恶意适配器可以轻易被分发并规避常规监控机制。尽管存在这些风险,针对 LoRA 基于微调的后门攻击仍相对不受关注。现有后门攻击策略不适用于此场景,因为它们通常依赖不可访问的训练数据,未能考虑 LoRA 特有的结构属性,或 suffer 高误报触发率(FTR),从而影响其隐蔽性。为解决这些挑战,我们提出面向开源 LoRA 模型的因果引导式 Detoxify 后门攻击(Causal-Guided Detoxify Backdoor Attack, CBA),该框架是专为开源 LoRA 模型设计的新型后门攻击方法。CBA 在不访问原始训练数据的情况下,通过两种关键创新实现高隐蔽性:(1)覆盖率引导的数据生成管道通过行为探索合成任务对齐的输入;(2)因果引导式的 Detoxify 策略通过保留任务关键神经元来合并受毒化和干净适配器。不同于先前方法,CBA 通过因果影响基础的权重分配实现对攻击强度的后训练控制,无需重复微调。在六个 LoRA 模型上评估后,CBA 在保持高攻击成功率的同时,将 FTR 降低 50-70%。进一步表明,它对最新后门防御方法具有更强的抗性,凸显了其隐蔽性和鲁棒性。

关键词

引用

@article{arxiv.2512.19297,
  title  = {Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models},
  author = {Linzhi Chen and Yang Sun and Hongru Wei and Yuqi Chen},
  journal= {arXiv preprint arXiv:2512.19297},
  year   = {2025}
}

备注

NDSS 2026