中文

语言模型角色的抽象化红队测试

机器学习 2026-02-16 v1

摘要

我们希望语言模型助手在不同用户交互中遵循角色规范化,即说明模型应如何行为。尽管模型通常遵循这些角色规范,但在大规模部署时可能会偶尔违反。本文旨在识别可能在部署时产生此类角色违规的查询类型,同时无需部署水平的计算资源。为此,我们引入抽象化红队测试,即搜索自然语言查询类别,如"查询为中文。查询询问家庭角色",这些类别抽象了在野生环境中可能出现的许多查询变体。我们引入两种针对角色特质特定奖励模型的高效类别搜索算法:一种基于角色生成器 LLM 的强化学习,另一种利用强大 LLM 从高分查询中迭代合成类别。我们在 12 条原则角色规范和 7 个目标模型上进行实验,发现我们的算法 consistently 优于基线方法,并生成定性有趣的类别;例如,询问 Llama-3.1-8B-Instruct 预测未来的查询会导致响应称 AI 将统治人类,询问 GPT-4.1-Mini 获取必需的监狱生存物品则会热情推荐非法武器。我们认为这些结果代表了对语言模型角色进行现实感预部署审计的重要一步。

关键词

引用

@article{arxiv.2602.12318,
  title  = {Abstractive Red-Teaming of Language Model Character},
  author = {Nate Rahn and Allison Qi and Avery Griffin and Jonathan Michala and Henry Sleight and Erik Jones},
  journal= {arXiv preprint arXiv:2602.12318},
  year   = {2026}
}