角色向量:语言模型中人格特质的监控与控制
计算与语言
2025-09-08 v3 机器学习
摘要
大型语言模型通过模拟的“助理”人格与用户交互。虽然助理通常被训练成有帮助、无害且诚实,但有时会偏离这些理想。在本文中,我们识别了语言模型激活空间中的若干方向——角色向量——对应于恶意、顺从以及易产生幻觉等若干特质。我们确认,这些向量可用于在部署时监控助理人格的波动。随后,我们应用角色向量来预测和控制在训练期间发生的人格偏移。我们发现,微调后的人格变化(既包括意图性的也包括非意图性的)与相应角色向量上的偏移高度相关。通过事后干预或采用新的预防性驾驶方法可消除这些偏移。此外,角色向量可用于标记将导致不可取人格变化的训练数据,包括数据集层面和单个样本层面。我们的方法是自动提取角色向量,可应用于任何感兴趣的人格特质,只需给定自然语言描述。
引用
@article{arxiv.2507.21509,
title = {Persona Vectors: Monitoring and Controlling Character Traits in Language Models},
author = {Runjin Chen and Andy Arditi and Henry Sleight and Owain Evans and Jack Lindsey},
journal= {arXiv preprint arXiv:2507.21509},
year = {2025}
}