DualEdit:通过肯定-拒绝调节缓解LLM后门编辑中的安全回退
计算与语言
2026-03-25 v2
摘要
安全对齐的大语言模型仍然容易受到后门攻击。近期的基于模型编辑的方法通过直接修改少量参数将触发词映射到攻击者期望的行为,从而实现高效的后门注入。然而,我们发现现有的基于编辑的攻击在安全对齐下往往不稳定:编辑后的模型可能在生成过程中以肯定前缀开始,但随后回退为拒绝。我们将这一现象称为安全回退。为缓解这一问题,我们提出了DualEdit,一个双目标模型编辑框架,同时促进肯定词元并抑制拒绝词元。DualEdit进一步通过两种互补技术解决了两个关键挑战:目标不平衡和拒绝多样性:(1) 动态损失加权,利用编辑前模型校准两个目标的相对尺度以稳定优化;(2) 值锚定,将代表性注意力值向量聚类形成紧凑锚点,减少来自过度多样化词元集的冲突并提高泛化能力。在安全对齐LLM上的实验表明,DualEdit相比基线方法将攻击成功率提高了10%,并将安全回退率降低了11%。
引用
@article{arxiv.2506.13285,
title = {DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation},
author = {Houcheng Jiang and Zetong Zhao and Junfeng Fang and Haokai Ma and Ruipeng Wang and Xiang Wang and Xiangnan He and Yang Deng},
journal= {arXiv preprint arXiv:2506.13285},
year = {2026}
}