解除触发器:基于尾风内几何平滑的大语言模型后门防御
密码学与安全
2026-04-28 v1 人工智能
摘要
防御大型语言模型中的后门攻击仍是关键实践挑战。现有防御措施通常会因离线净化导致高准备成本和实用性下降,或通过复杂的在线干预引入严重延迟。为克服这两种困境,我们提出尾风内几何平滑(TIGS),一种无需参数更新、外部干净数据或辅助生成的即插即用推理时防御。TIGS利用成功后门触发器在语义内容区域持续引发注意力崩溃的观察。在原生前向传递中完全运行,TIGS首先执行内容感知的尾风筛查,以使用样本内部信号识别可疑注意力头和行。随后应用内在几何平滑:弱内容域校正保持语义锚定,而更强的全行收缩干扰触发器主导路由。最后,受控的全行写回重构注意力矩阵,以确保推理稳定性。广泛的评估表明,TIGS显著抑制了攻击成功率,同时严格保持干净推理和开放式语义一致性。关键在于,这种有利的安全-实用性-延迟平衡在 diverse architectures(包括密集型、面向推理和稀疏专家混合模型)中得以维持。通过结构性地扰乱对抗路由并保持轻微的延迟开销,TIGS确立了一种高度实用的、面向部署的SOTA大语言模型防御标准。
引用
@article{arxiv.2604.24162,
title = {Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing},
author = {Kaisheng Fan and Weizhe Zhang and Yishu Gao and Tegawendé F. Bissyandé and Xunzhu Tang},
journal= {arXiv preprint arXiv:2604.24162},
year = {2026}
}