中文

心理测量人格塑造对语言模型能力与安全性的调节作用

人工智能 2025-09-23 v1 计算与语言

摘要

大型语言模型日益介入高风险交互,加剧了对其能力与安全性的研究。尽管近期工作表明 LLM 表现出一致且可测量的合成人格特质,但关于调节这些特质如何影响模型行为仍知之甚少。我们通过研究基于大五人格框架的心理测量人格控制如何影响 AI 在能力与安全基准测试中的行为,填补了这一空白。我们的实验揭示了显著效应:例如,降低尽责性会导致在 WMDP、TruthfulQA、ETHICS 与 Sycophancy 等基准测试中安全相关指标的显著下降,以及由 MMLU 测量的通用能力的降低。这些发现表明,人格塑造是一个强大且尚未充分探索的模型控制轴线,与安全性和通用能力均存在相互作用。我们讨论了其对安全评估、对齐策略、部署后引导模型行为以及与可能利用这些发现相关的风险的启示。我们的发现为 LLM 中人格敏感的安全评估与动态行为控制开辟了新的研究方向。

关键词

引用

@article{arxiv.2509.16332,
  title  = {Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models},
  author = {Stephen Fitz and Peter Romero and Steven Basart and Sipeng Chen and Jose Hernandez-Orallo},
  journal= {arXiv preprint arXiv:2509.16332},
  year   = {2025}
}