LLM 中人格表征的定位
计算与语言
2025-09-10 v3 人工智能
摘要
我们提出了一项关于人格——由独特的人类特征、价值观和信仰集合所定义——如何以及在何处被编码在大型语言模型(LLM)的表征空间中的研究。使用一系列降维和模式识别方法,我们首先识别出在编码这些表征时表现出最大差异的模型层。然后,我们分析所选层内的激活,以检查特定人格相对于其他人格的编码方式,包括它们共享和独立的嵌入空间。我们发现,在多个预训练的纯解码器 LLM 中,所分析的人格仅在解码器层的最后三分之一部分在表征空间中表现出巨大差异。我们观察到特定伦理视角(如道德虚无主义和功利主义)的激活存在重叠,表明存在一定程度的多义性。相比之下,保守主义和自由主义等政治意识形态似乎表征在更独立的区域中。这些发现有助于提高我们对 LLM 如何在内部表征信息的理解,并可为未来改进 LLM 输出中特定人类特征的调制工作提供参考。警告:本文包含可能具有冒犯性的示例陈述。
引用
@article{arxiv.2505.24539,
title = {Localizing Persona Representations in LLMs},
author = {Celia Cintas and Miriam Rateike and Erik Miehling and Elizabeth Daly and Skyler Speakman},
journal= {arXiv preprint arXiv:2505.24539},
year = {2025}
}
备注
To appear in the AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2025