利用内部激活对大型语言模型进行稳定且可解释的人格特质评估
计算与语言
2026-01-16 v1
摘要
评估大型语言模型(LLMs)的人格特质是模型解释、比较和负责任部署的关键。然而,现有的基于问卷的评估方法稳定性有限且可解释性差,因为其结果对提示措辞或角色扮演配置的微小变化高度敏感。为解决这些局限性,我们提出了一种基于内部激活的方法,称为人格向量中性插值(PVNI),用于对LLMs进行稳定且可解释的人格特质评估。PVNI利用对比提示从模型的内部激活中提取与目标人格特质相关联的人格向量。然后,它通过沿人格向量作为锚轴进行插值来估计相应的中性分数,从而实现对中性提示表征与人格方向之间的可解释比较。我们对PVNI的有效性和泛化性质进行了理论分析。跨多种LLMs的广泛实验表明,即使在问卷和角色扮演变体下,PVNI也能产生比现有方法更稳定的人格特质评估。
引用
@article{arxiv.2601.09833,
title = {Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal Activations},
author = {Xiaoxu Ma and Xiangbo Zhang and Zhenyu Weng},
journal= {arXiv preprint arXiv:2601.09833},
year = {2026}
}