人格-模型坍缩与新兴不对齐现象
计算与语言
2026-05-26 v2 人工智能
密码学与安全
机器学习
摘要
在狭窄数据上进行微调大型语言模型会产生不良内容,从而在与之无关的提示上表现出广泛不对齐,这一现象称为新兴不对齐。我们提出新兴不对齐涉及人格-模型坍缩:模型内部能力下降,无法模拟、区分和维持一致的字符。我们通过两种指标进行行为检验:道德易受性 (S) 和道德鲁棒性 (R),这两种指标分别基于模型在角色扮演下,对道德基础问卷 (Moral Foundations Questionnaire) 响应的跨人格和在人格内变异性计算。这些指标形式化了模型区分角色 (S) 的能力以及在模拟给定角色时保持一致性 (R) 的能力。我们评估了四个前沿模型 (DeepSeek-V3.1、GPT-4.1、GPT-4o、Qwen3-235B) 的三个变体:基础版本、微调后输出不安全代码,以及与之匹配的控制微调后输出安全代码。在四个模型中,不安全微调导致 S 平均增加 55%,将所有不安全变体推向 13 个前沿模型基准中观察到的全部范围之外 —— GPT-4o 触及上限的两倍以上 —— 指示差异失控。它还导致 R 平均下降 65%,相当于 1/R 增加 304%。相比之下,匹配的安全控制在保持 S 接近基础版本的同时,只引起部分 R 损失,表明这些效应主要是特定于不对齐的。补充这些指标变化,不安全变体的无条件响应趋向于接近规模上限的饱和,显著偏离基础模型的结构化响应以及当基础模型角色扮演有毒人格时所引发的响应。综上,这些指标为新兴不对齐提供了敏感诊断工具,并作为人格-模型坍缩的行为证据。
引用
@article{arxiv.2605.12850,
title = {Persona-Model Collapse in Emergent Misalignment},
author = {Davi Bastos Costa and Renato Vicente},
journal= {arXiv preprint arXiv:2605.12850},
year = {2026}
}
备注
23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL