中文

激活空间人格驾驶:用于 LLM 中稳定性格控制的混合层选择

计算与语言 2026-03-09 v2

摘要

大型语言模型在生成过程中表现出隐式人格,但可靠地控制或对齐这些特征以满足特定需求仍是开放的挑战。有效机制以在生成期间操控模型行为的需求是文献中存在的关键性空白,需要被实现。人格感知的 LLM 作为实现这一目标的有前景的方向。然而,人格构成与 LLM 内部表示之间的关系仍未得到充分探索,亟需进一步调查。此外,探索这些表示如何用于驾驭模型行为也颇具探索价值。我们提出了一条新型管道,通过从变换层提取隐藏状态激活,应用 Big Five 人格特质(开放性、尽责性、外向性、合作性和神经质),该框架是综合且经实证验证的人格模型方法,运用低秩子空间发现方法,并识别不同模型架构中各特质的最优层,以实现稳健的注入。最终得到的人格对齐方向通过具备动态层选择的灵活驾驶框架进行操作,实现对 LLM 输出中特质表达的精确控制。我们的发现表明,人格特质占据低秩共享子空间,这些潜在结构可通过谨慎的扰动转化为有效驾驭机制,而不会影响流畅性、方差和通用能力,从而有助于搭建心理学理论与实际模型对齐之间的鸿沟。

关键词

引用

@article{arxiv.2511.03738,
  title  = {Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs},
  author = {Pranav Bhandari and Nicolas Fay and Sanjeevan Selvaganapathy and Amitava Datta and Usman Naseem and Mehwish Nasim},
  journal= {arXiv preprint arXiv:2511.03738},
  year   = {2026}
}

备注

Accepted to EACL 2026