从投毒到觉醒:培养大语言模型后门自我意识
密码学与安全
2025-10-08 v1 人工智能
摘要
大型语言模型(LLM)可以通过后门攻击获取欺骗行为,当输入中出现密钥触发词时,模型会执行被禁止的动作。现有的安全训练方法在很大程度上无法解决这一漏洞,因为不易揭示模型中植入的隐藏触发词。针对近期关于 LLM situational awareness(情境意识)的发现,本文提出一种新颖的后训练框架,通过培养模型对后门风险的自我意识,使其能够在提示中不存在触发词时,能够表达植入的触发词。该方法的核心引入了受控奖励信号驱动的、受 inversion 启发的强化学习框架,鼓励模型对自身行为进行内省推理,并逆向工程导致不一致输出的触发词。经过这一过程,一个受毒化的模型将被转化为能够精确识别其植入触发词的模型。令人惊讶的是,我们观察到这种后门自我意识在短暂的训练窗口内突然出现,类似于能力的相位转变。基于这种涌现特性,本文进一步提出两种互补的防御策略,用于缓解和检测后门威胁。在五种后门攻击实验中,对比六种基线方法,结果表明该方法具有强大的潜力,能提高 LLM 针对后门风险的鲁棒性。代码已公开于 LLM Backdoor Self-Awareness。
引用
@article{arxiv.2510.05169,
title = {From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs},
author = {Guangyu Shen and Siyuan Cheng and Xiangzhe Xu and Yuan Zhou and Hanxi Guo and Zhuo Zhang and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2510.05169},
year = {2025}
}