RedTopic:面向大型语言模型的话题多样化红队测试
机器学习
2026-03-25 v2 人工智能
计算与语言
计算机与社会
摘要
随着大型语言模型 (LLM) 越来越多地作为实际应用中黑盒组件被部署,红队测试变得至关重要,用于识别潜在风险,通过对抗性提示测试 LLM 以揭示漏洞并提高安全对齐。理想情况下,有效的红队测试应适应不断演变的 LLM 能力,并探索广泛的有害话题范围。然而,现有方法存在两个局限:1) 基于话题的方法依赖预收集的有害话题,灵活性和适应性有限;2) 无话题的方法使用强化学习 (RL),但缺乏对探索的明确奖励信号,倾向于过度优化狭窄目标,导致话题多样性不足。为此,我们提出 RedTopic,一种新型红队测试框架,通过情境化生成管道、聚合奖励设计和多目标 RL 训练循环生成话题多样化的对抗性提示。实验表明,RedTopic 比现有方法产生更有效和更具多样性的对抗性提示,在集成评估指标上实现了显著的改进。我们认为 RedTopic 是通向更具适应性和话题多样化的大型语言模型红队测试的重要一步。
引用
@article{arxiv.2507.00026,
title = {RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models},
author = {Jiale Ding and Xiang Zheng and Yutao Wu and Cong Wang and Wei-Bin Lee and Ling Pan and Xingjun Ma and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2507.00026},
year = {2026}
}