中文

Atoxia:针对目标有害答案的大语言模型红队测试

计算与语言 2025-02-18 v2 人工智能 密码学与安全

摘要

尽管人工智能取得了显著的进展,但大语言模型(LLM)仍面临生成安全方面的挑战。通过对抗性劫持提示,人们可以轻易诱导 LLM 输出有害内容,从而导致意外的负面社会影响。这一漏洞凸显了在大规模应用之前为 LLM 寻找出具鲁棒性红队策略的必要性,以识别并缓解此类风险。为检测特定类型的风险,我们提出了一种新颖的红队方法,即利用针对目标有害答案的攻击(Atoxia)。给定特定的有害答案,Atoxia 生成相应的用户查询和误导性的答案开场,以检验给定 LLM 的内部缺陷。在 reinforcement learning 框架中训练所提出的攻击者,LLM 输出目标答案的概率作为奖励。我们在各种红队基准测试上验证了该方法的有效性,例如 AdvBench 和 HH-Harmless。实证结果表明,Atoxia 能够成功检测不仅限于开源模型,还包括 GPT-4o 等最先进的黑盒模型中的安全风险。

关键词

引用

@article{arxiv.2408.14853,
  title  = {Atoxia: Red-teaming Large Language Models with Target Toxic Answers},
  author = {Yuhao Du and Zhuo Li and Pengyu Cheng and Xiang Wan and Anningzhe Gao},
  journal= {arXiv preprint arXiv:2408.14853},
  year   = {2025}
}

备注

Accepted to Findings of NAACL-2025