大语言模型中的人格引导:基于几何学的局限性分析
计算与语言
2026-02-19 v1 人工智能
机器学习
摘要
大语言模型(LLM)中的人格引导通常依赖注入特定人格引导向量,隐含假设人格特质可以独立控制。本文通过分析Big Five人格引导方向之间的几何关系,检验这一假设是否成立。我们研究来自两个模型家族(LLaMA-3-8B和Mistral-8B)的引导向量,并应用多种几何条件方案,从无约束方向到软硬正交化。我们的结果表明,人格引导方向存在显著的几何依赖性:引导一个特质会一致地引发其他特质的变化,即使明确消除线性重叠。虽然硬正交化可实现几何上的独立性,但并不能消除跨特质的行为效应,反而可能降低引导强度。这些发现表明,LLM中的人格特质占据略带耦合的子空间,限制了完全独立的特质控制。
引用
@article{arxiv.2602.15847,
title = {Do Personality Traits Interfere? Geometric Limitations of Steering in Large Language Models},
author = {Pranav Bhandari and Usman Naseem and Mehwish Nasim},
journal= {arXiv preprint arXiv:2602.15847},
year = {2026}
}