DPN-LE:面向大语言模型的双重人格神经元定位与编辑
计算与语言
2026-05-01 v1
摘要
随着大语言模型(LLMs)的广泛采用,理解其人格表征机制变得至关重要。作为人格编辑中的一种新范式,大多数现有方法采用神经元编辑来定位和修改LLM神经元,这需要更改大量神经元并导致显著的性能下降。这引发了一个根本性问题:所有被修改的神经元都与人格表征直接相关吗?在这项工作中,我们通过评估通用能力影响和表征层面模式来研究并量化这种特异性。我们发现:1) 当前方法可以改变人格,但会降低整体性能。2) 神经元是多功能的,连接着人格特质和通用知识。3) 对立的人格特质表现出明显互斥的表征模式。受这些发现的启发,我们提出了DPN-LE(双重人格神经元定位与编辑),它通过对比高特质和低特质样本之间的MLP激活来识别人格特异性神经元。DPN-LE构建逐层引导向量,并应用基于Cohen's 效应量和激活幅度的双重标准过滤,以分离出互斥的神经元子集。对这些神经元进行稀疏线性干预,可以在推理时实现精确的人格控制。每个特质仅使用1000对对比样本,DPN-LE干预了约0.5\%的神经元,同时实现了具有竞争力的人格控制,并在推理任务上显著更好地保持了能力。在LLaMA-3-8B-Instruct和Qwen2.5-7B-Instruct上的实验证明了我们方法的有效性和泛化性。
引用
@article{arxiv.2604.27929,
title = {DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models},
author = {Lifan Zheng and Xue Yang and Jiawei Chen and Chenyan Wu and Jingyuan Zhang and Fanheng Kong and Xinyi Zeng and Xiang Chen and Yu Tian},
journal= {arXiv preprint arXiv:2604.27929},
year = {2026}
}