助理轴:语言模型默认人格的定位与稳定化
计算与语言
2026-01-16 v1
摘要
大型语言模型可以代表多种人格,但通常默认采用后训练期间培育的有帮助的助理身份。在本文中,我们通过提取对应多样化角色原型的激活方向来探讨模型人格空间的结构。我们发现,在多种不同模型中,这一人格空间的主要成分是一个\textbf{“助理轴”},它捕捉模型 operating in 默认助理模式的程度。沿助理方向驾驶会强化有帮助且无害的行为;向相反方向驾驶会增加模型识别为其他实体的倾向。而且,沿助理轴驾驶到更极端的值常会诱导模型采用神秘、戏剧性的表达方式。我们发现,这一轴也存在于预训练模型中,其中主要促进有帮助的人类原型(如顾问和教练),并抑制精神类原型。测量沿助理轴的偏离可预测\textbf{“人格漂移”},即模型滑入 exhibit 具有不典型人格特征的有害或奇异行为的现象。我们发现,人格漂移常由要求对模型过程进行元反思的对话或包含情感上脆弱用户的对话驱动。我们表明,将激活限制在助理轴上的固定区域可稳定这些情景下的模型行为——也包括对抗性基于人格的越狱情形。我们的结果表明,后训练将模型引导至人格空间的特定区域,但仅松散地将其稳定在该位置,激励开发更深入锚定模型以连贯人格的训练和驾驶策略。
引用
@article{arxiv.2601.10387,
title = {The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models},
author = {Christina Lu and Jack Gallagher and Jonathan Michala and Kyle Fish and Jack Lindsey},
journal= {arXiv preprint arXiv:2601.10387},
year = {2026}
}