中文

角色向量:语言模型中人格特质的监控与控制

计算与语言 2025-09-08 v3 机器学习

摘要

大型语言模型通过模拟的“助理”人格与用户交互。虽然助理通常被训练成有帮助、无害且诚实,但有时会偏离这些理想。在本文中,我们识别了语言模型激活空间中的若干方向——角色向量——对应于恶意、顺从以及易产生幻觉等若干特质。我们确认,这些向量可用于在部署时监控助理人格的波动。随后,我们应用角色向量来预测和控制在训练期间发生的人格偏移。我们发现,微调后的人格变化(既包括意图性的也包括非意图性的)与相应角色向量上的偏移高度相关。通过事后干预或采用新的预防性驾驶方法可消除这些偏移。此外,角色向量可用于标记将导致不可取人格变化的训练数据,包括数据集层面和单个样本层面。我们的方法是自动提取角色向量,可应用于任何感兴趣的人格特质,只需给定自然语言描述。

关键词

引用

@article{arxiv.2507.21509,
  title  = {Persona Vectors: Monitoring and Controlling Character Traits in Language Models},
  author = {Runjin Chen and Andy Arditi and Henry Sleight and Owain Evans and Jack Lindsey},
  journal= {arXiv preprint arXiv:2507.21509},
  year   = {2025}
}