中文

人格不宜: 单方法安全评估对人格化大语言模型不完整

人工智能 2026-04-15 v2

摘要

人格化定制了大语言模型的行为,但安全评估几乎只研究基于提示的人格。我们表明这不完整:提示驱动和激活引导暴露出*不同*且取决于架构的脆弱性轮廓,仅用一种方法进行测试会遗漏模型主导的失效模式。在4个标准模型(来自3种架构家族)上进行5,568项评估结果的分析中,系统提示下的危险等级排序在所有架构中得以保持(ρ=0.71--0.96),但激活引导的脆弱性呈现明显分歧:Llama-3.1-8B在激活引导方面显著更脆弱,而Gemma-3-27B和Qwen3.5则更易受提示侧攻击。最引人注目的这种分歧体现在“亲和人格悖论”:在Llama-3.1-8B上,P12(高度尽责+高度合作)在提示下属于最安全的人格,却成为激活引导下的最高ASR人格(ASR约0.818)。这种反转在系数消除和匹配强度校准下均保持稳健,并在DeepSeek-R1-Distill-Qwen-32B上复制。一种以 conscientiousness 强烈反向与拒绝相容的人格对齐框架,提供了部分几何解释。推理仅提供部分保护:两个32B推理模型在提示侧达到15--18%的ASR,激活引导在基线易受性和人格特定脆弱性方面将其严格分离。启发式轨迹诊断表明,更安全的模型保留了更强的策略记忆和自我纠正行为,而不仅仅是更长的推理。

关键词

引用

@article{arxiv.2604.11120,
  title  = {Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs},
  author = {Wenkai Li and Fan Yang and Shaunak A. Mehta and Koichi Onoue},
  journal= {arXiv preprint arXiv:2604.11120},
  year   = {2026}
}