心理概念神经元:神经控制是否偏向探测和生成转换中的 LLM?
计算与语言
2026-04-14 v1
摘要
使用心理学概念如大五人格 (Big Five),大语言模型 (LLM) 可模拟特定的人格轮廓并预测用户的人格。虽然 LLM 能表现出与这些概念一致的行为,但这些概念在模型内部的表示位置及其与行为输出的关系尚不明了。为此,我们聚焦于问卷操作化的 Big Five 概念,分析其内部表示的形成与局部化,并通过干预来检验这些表示如何与行为输出相关。我们的实验中,我们首先使用探测技术检查 Big Five 信息在模型深度中的出现位置。随后,我们识别出对每种 Big Five 概念作出选择性反应的神经元,并测试增强或抑制其激活是否能偏向潜在表示和标签生成。我们发现,Big Five 信息在早期层中迅速可解码,并在最终层中保持可检测,而概念选择性神经元在中层中最常见,跨域之间存在有限的重叠。对这些神经元的干预能持续地将探测读数偏向目标概念,对某些概念而言,定向成功率可超过 0.8,这表明模型内部对大五人格性格特质的分离是可因果操控的。对于标签生成层面,相同的干预常常偏向生成的标签分布,但效果较弱、更依赖概念,常伴随跨特质的溢出,这表明即便在对大量概念选择性神经元进行干预后,对生成标签的控制也相当困难。总体而言,我们的发现揭示了表示控制与行为控制之间在 LLM 中的差距。
引用
@article{arxiv.2604.11802,
title = {Psychological Concept Neurons: Can Neural Control Bias Probing and Shift Generation in LLMs?},
author = {Yuto Harada and Hiro Taiyo Hamada},
journal= {arXiv preprint arXiv:2604.11802},
year = {2026}
}