保持角色,保持安全:基于双循环对抗自我进化的安全角色扮演智能体
人工智能
2026-02-17 v1
摘要
基于大语言模型(LLM)的角色扮演在忠实度方面取得了快速进展,但更强的角色约束遵循往往会增加针对高风险或负面角色的越狱攻击风险。大多数先前工作通过训练时解决方案(例如数据精选或对齐正则化)来缓解此问题。然而,这些方法在角色和攻击策略不断演变时维护成本高昂,可能导致角色行为退化,通常也不适用于前沿封闭型大语言模型。我们提出了一种训练无关的双循环对抗自我进化框架,包含两个耦合循环。一个 Persona-Targeted Attacker Cycle 合成越来越强的越狱提示,而一个 Role-Playing Defender Cycle 则将观察到的失败蒸馊到分层知识库中,包括(i)全局安全规则、(ii)基于角色的约束、(iii)安全角色示例。在推理时,防御者从该层次结构中检索和组合结构化知识,以指导生成,产生符合目标角色同时满足安全约束的响应。在多个专有大语言模型上的大规模实验表明,该方法在角色忠实度和越狱抵抗力方面均优于强基线,并且对未见角色和攻击提示具有稳健的泛化能力。
引用
@article{arxiv.2602.13234,
title = {Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents},
author = {Mingyang Liao and Yichen Wan and shuchen wu and Chenxi Miao and Xin Shen and Weikang Li and Yang Li and Deguo Xia and Jizhou Huang},
journal= {arXiv preprint arXiv:2602.13234},
year = {2026}
}