中文

Backdoor4Good:面向 LLM 中有益后门用途的基准测试

密码学与安全 2026-03-10 v1 人工智能

摘要

后门机制传统上被研究为危及机器学习模型完整性的安全威胁。然而,相同的机制——通过输入触发器对特定行为进行条件激活——也可作为可控且可审计的接口,用于可信赖的模型行为。在本工作中,我们提出了 Backdoor4Good (B4G),一个用于大型语言模型 (LLMs) 中有益后门应用的统一基准和框架。不同于传统后门研究聚焦于攻击和防御,B4G 将后门条件重新用于增强安全性、可控性和可审计性的有益任务。它在 (T, A, U) 的三元公式下正式化了有益后门学习,代表触发器 (Trigger)、激活机制 (Activation mechanism) 和效用函数 (Utility function),并实现了覆盖四个信任中心应用的基准。通过在 Llama3.1-8B、Gemma-2-9B、Qwen2.5-7B 和 Llama2-13B 上的大量实验,我们表明有益后门可实现高可控性、抗篡改性和隐身性,同时保持干净任务性能。我们的发现表明,后门不必本质上是恶意的;当 Properly 设计时,它们可作为可模块化、可解释且有益的构建块,用于可信赖的人工智能系统。我们的代码和数据集已提供给 https://github.com/bboylyg/BackdoorLLM/B4G。

关键词

引用

@article{arxiv.2603.07452,
  title  = {Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs},
  author = {Yige Li and Wei Zhao and Zhe Li and Nay Myat Min and Hanxun Huang and Yunhan Zhao and Xingjun Ma and Yu-Gang Jiang and Jun Sun},
  journal= {arXiv preprint arXiv:2603.07452},
  year   = {2026}
}

备注

19 pages, 5 figures