中文

基于防御性演示的黑盒大语言模型测试时后门缓解方法

计算与语言 2025-02-13 v2

摘要

现有的后门防御研究主要集中于训练阶段,忽视了测试时防御这一关键方面。在作为 Web 服务部署的 LLM 中,这一缺口尤为突出,此类服务通常仅提供黑盒访问,使得训练时防御难以实施。为弥补此缺口,本研究批判性考察了在黑盒 LLM 中将演示用作抵御后门攻击的防御机制。我们从干净数据池中检索任务相关演示,并在测试时将其与用户查询相整合。该方法无需修改或调优模型,也不要求了解模型内部架构。上下文学习固有的对齐特性在减轻后门触发器影响方面发挥关键作用,有效重新校准被攻陷模型的行为。我们的实验分析表明,该方法能稳健防御实例级与指令级后门攻击,在大多数评估场景中优于现有防御基线。

关键词

引用

@article{arxiv.2311.09763,
  title  = {Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations},
  author = {Wenjie Mo and Jiashu Xu and Qin Liu and Jiongxiao Wang and Jun Yan and Hadi Askari and Chaowei Xiao and Muhao Chen},
  journal= {arXiv preprint arXiv:2311.09763},
  year   = {2025}
}

备注

Findings of NAACL 2025