中文

Red-Bandit:基于多臂老虎机引导的 LoRA 专家测试时适应 LLM 红队

计算与语言 2026-05-19 v2

摘要

自动化红队测试已成为在部署前审计 大语言模型 (LLM) 的可扩展方法,但现有方法缺乏机制高效适应模型特定漏洞。我们引入 Red-Bandit,一个在推理时适应以识别和利用模型失效模式的红队框架,支持不同攻击风格(如操纵、俚语)下的针对性攻击。Red-Bandit 在推理时对一组参数高效的 LoRA 专家进行后训练,每个专家针对特定攻击风格进行优化,使用强化学习获得不安全提示生成的奖励。多臂老虎机策略在推理时根据目标模型的响应安全性动态选择攻击风格专家,平衡探索与开发。Red-Bandit 在充分探索下实现 AdvBench 上的最新成果 (ASR@10),同时生成更具可读性的提示 (更低的 perplexity)。此外,Red-Bandit 的老虎机策略可作为诊断工具,揭示哪些攻击风格最有效地诱发不安全行为。

关键词

引用

@article{arxiv.2510.07239,
  title  = {Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts},
  author = {Christos Ziakas and Nicholas Loo and Nishita Jain and Alessandra Russo},
  journal= {arXiv preprint arXiv:2510.07239},
  year   = {2026}
}

备注

Accepted to the Main Conference at ACL 2026