BackFlush:大语言模型中无知识依赖的后门检测与消除及水印保护
密码学与安全
2026-05-14 v1
摘要
近期趋势显示,大语言模型(LLM)可能遭受后门攻击,这类攻击通过训练期或模型编辑注入恶意触发器,以在特定输入模式下生成有害输出,同时在正常输入上保持干净性能。正当的水印作为所有权签名与后门共享类似机制,构成关键挑战:在不损害水印完整性的前提下检测和消除未知后门。现有防御方法需要提前了解触发器或其有效载荷,依赖干净参考模型,或在不保留水印的情况下牺牲模型实用性。为解决这些限制,我们提出 BackFlush 及其变体,一个在保持水印完整性的前提下进行后门检测与消除的统一框架。我们提出两个新观察:后门冲刷现象——注入和忘卸辅助数据可消除既有后门;后门易感性放大——实现与词汇表大小无关的常数时间检测。BackFlush 采用基于旋转的参数编辑(RoPE)忘卸技术,通过旋转嵌入来消除后门,同时保留水印。全面评估显示,BackFlush 在不同架构上覆盖多种触发器类型,攻击成功率约为 1%,干净准确率约为 99%,且保留水印功能,在能够同时维持模型实用性、提供干净基线水平的前提下,尚无其他方法实现此效果。代码可在 https://github.com/JagadeeshAI/BackFlush IJCNN.git 获取。
引用
@article{arxiv.2605.12529,
title = {BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models},
author = {Jagadeesh Rachapudi and Ritali Vatsi and Pranav Singh and Praful Hambarde and Amit Shukla},
journal= {arXiv preprint arXiv:2605.12529},
year = {2026}
}