中文

从角色中解构意图:基于对抗自我博弈的面向人格不变性安全对齐

人工智能 2026-05-05 v1

摘要

大型语言模型(LLM)日益增强的能力推动了其在各类领域的广泛部署,甚至包括潜在高风险场景。尽管安全对齐技术取得了进展,当前模型仍然容易受到新兴的人格基因型攻击。现有针对人格基因型攻击的研究主要聚焦于攻击迭代,缺乏对防御侧的系统性和机制性约束。为此,我们提出了 Persona-Invariant Alignment(PIA),一种基于对抗自我博弈的人格不变性对齐框架,通过在攻击侧引入 Persona Lineage Evolution(PLE)实现演化,再通过在防御侧引入 Persona-Invariant Consistency Learning(PICL)实现防御。理论上,PICL 基于结构分离假设,采用单向 KL 散度约束实现安全决策与人格背景的结构解耦,从而在人格基因型攻击下仍保持安全行为。实验结果表明,PLE 通过 lineage-based 信用传播有效探索高风险人格空间;PICL 防御方法显著降低攻击成功率(ASR),同时保持模型的通用能力,验证了该对齐范式的优越性和鲁棒性。代码已公开于 https://github.com/JiajiaLi-1130/PIA。

关键词

引用

@article{arxiv.2605.01899,
  title  = {Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment},
  author = {Jiajia Li and Xiaoyu Wen and Zhongtian Ma and Shuyue Hu and Qiaosheng Zhang and Zhen Wang},
  journal= {arXiv preprint arXiv:2605.01899},
  year   = {2026}
}