追踪大语言模型预训练中的人格向量
计算与语言
2026-05-14 v1 人工智能
摘要
大型语言模型如何内部表征高层次行为是一项核心的可解释性问题,具有直接关联到AI安全的意义:它决定了我们能否检测、审计或干预这些模型。近期研究表明,诸如邪恶或讨好等性格特质对应于内部激活中的线性方向,称为人格向量。尽管这些向量如今在安全相关场景中被常规地用于检查和引导模型行为,但它们在训练期间是如何形成的仍未为人所知。为填补这一空白,我们追踪了 OLMo-3-7B 模型预训练过程中的人格向量,发现人格向量形成得相当晚早——仅占 OLMo-3 预训练的 0.22%,且在完全经过指令微调的模型中仍能有效用于引导。尽管核心表征在早期形成,但人格向量在预训练整个过程中仍不断进行几何和语义上的细化。我们进一步比较了不同的诱导策略,发现所有策略都能产生有效的方向,且每种策略都揭示了底层人格的不同质段。我们在 Apertus-8B 上复现了我们的分析,发现我们的发现在 OLMo-3 之外也具有准确的传承性。我们的结果确立了人格表征为早期预训练中稳定特征,为研究训练如何形成、细化和塑造这些表征开辟了研究之路。
引用
@article{arxiv.2605.13329,
title = {Tracing Persona Vectors Through LLM Pretraining},
author = {Viktor Moskvoretskii and Dominik Glandorf and Jorge Medina Moreira and Tanja Käser and Robert West},
journal= {arXiv preprint arXiv:2605.13329},
year = {2026}
}
备注
Preprint