中文

人格几何:大型语言模型中人格与推理的解耦

机器学习 2025-12-09 v1 人工智能

摘要

背景:大型语言模型(LLM)的个性化部署目前受制于稳定性-塑性困境。流行的对齐方法,如监督式微调(Supervised Fine-Tuning, SFT),依赖随机权重更新,常导致“对齐税”——损害通用推理能力。方法:我们提出Soul Engine框架,基于线性表示假设(Linear Representation Hypothesis),该假设认为人格特征存在于正交线性子空间中。我们引入SoulBench,通过动态语境抽样构建数据集。采用基于冻结Qwen-2.5底层模型的双头架构,从不修改底层权重的条件下提取解耦人格向量。结果:我们的实验显示三个突破性成果。首先,高精度轮廓化:模型对心理学真实值的均方误差(Mean Squared Error, MSE)为0.011。其次,几何正交性:t-SNE可视化确认人格流形是独立且连续的,可实现“零样本人格注入”而不损失原始模型智能。第三,确定性引导:我们通过向量算术实现对行为的稳健控制,经大量消融实验验证。结论:本工作挑战了个性化微调的必要性。通过从概率性提示转向确定性潜在干预,我们为安全可控的人工智能个性化提供了数学严谨的基础。

关键词

引用

@article{arxiv.2512.07092,
  title  = {The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models},
  author = {Zhixiang Wang},
  journal= {arXiv preprint arXiv:2512.07092},
  year   = {2025}
}

备注

10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B