中文

基于曲率引导的模块定位用于低秩净化带后门的大型语言模型

密码学与安全 2026-06-29 v1 人工智能

摘要

后门攻击对大型语言模型(LLM)构成严重威胁,当存在隐藏触发器时,会导致原本良性的系统产生攻击者指定的恶意行为。在这项工作中,我们研究了一种实际场景下对带后门的LLM进行事后净化,其中防御者可以访问被投毒模型,但不希望从头开始重新训练整个网络。我们提出了一种机制引导的权重空间修复框架,该框架首先使用激活修补和Fisher/K-FAC曲率分析来定位参与传播触发器诱导行为的模块,然后仅对最有影响力的模块应用有针对性的低秩修复。我们在\texttt{Llama-3.2-1B-Instruct}的投毒变体上评估了该方法,触发器被插入到原本良性提示的开头、中间和结尾。结果表明,所提出的方法在保持良性模型行为的同时,显著抑制了触发器条件下的恶意响应。这些发现表明,LLM中的后门移除可以被表述为一个局部结构修复问题,而不仅仅是一个广泛的行为对齐问题。

关键词

引用

@article{arxiv.2606.30899,
  title  = {Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models},
  author = {Arash Raftari and Mehrdad Mahdavi and Nathan Blackthorn and Andrew Arash Mahyari},
  journal= {arXiv preprint arXiv:2606.30899},
  year   = {2026}
}