中文

内在护栏:人格语义几何如何与大语言模型中的突发性错位相互作用

计算与语言 2026-05-12 v1 人工智能

摘要

在狭义数据上微调大型语言模型(LLM)有时会诱导广泛的有害行为,此类漏洞称为突发性错位(EM)。虽然已有研究将此类失效关联至激活空间的特定方向,但其与模型更广泛人格的关系尚未探讨。我们通过 established 的心理测量轮廓(如 Big Five、Dark Triad)以及 LLM 特定行为(如邪恶、奉承)映射 LLM 的潜在人格空间,证明语义几何在对齐模型及其受损微调版本中高度稳定。通过因果干预,我们发现隔离社交价值方向(如“邪恶”人格向量)以及我们引入的语义价值向量(SVV)作为内在护栏:削减它们会将错位率推至40%以上,而放大后可将失效模式压制至3%以下。利用人格空间的结构稳定性,我们展示可从指示微调模型中提取的向量实现零-shot 转移,成功调控受损微调版本中的 EM。总体而言,我们的发现表明,有害微调并未覆盖模型内部人格表征,允许保守的表征作为跨分布护栏发挥作用。

关键词

引用

@article{arxiv.2605.10633,
  title  = {Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs},
  author = {Krishak Aneja and Manas Mittal and Anmol Goel and Ponnurangam Kumaraguru and Vamshi Krishna Bonagiri},
  journal= {arXiv preprint arXiv:2605.10633},
  year   = {2026}
}

备注

20 pages, 9 figures including appendix