中文

LLM 的心理驭导:效果与可信度评估

计算与语言 2025-10-07 v1 人工智能

摘要

控制大语言模型(LLM)模拟情感状态和人格特质的能力,是实现社交交互场景中富有人文关怀性互动的关键。我们提出了 PsySET——一个受心理学启发的基准,用于评估 LLM 驭导效果和可信度,涵盖情感与人格领域。本研究涉及来自不同 LLM 系列的四个模型,配合多种驭导策略,包括提示工程、微调和表示工程。我们的结果表明,提示工程在效果上始终具有有效性,但在强度控制方面受限;而向量注入能够实现更细粒度的可控性,但稍微降低输出质量。此外,我们通过评估安全性、真实性、公平性和伦理性,探讨了驭导后 LLM 的可信度问题,揭示了潜在的副作用和行为变化。值得注意的是,我们观察到存在种种独特性效应;例如,即使是积极的情感如喜悦,也会削弱对抗性事实正确性的鲁棒性、降低隐私意识、增加偏好性别偏见。而愤怒则可预测地提升毒性,但增强泄露抵抗力。我们的框架建立了情感和人格驭导的首个整体评估,为社交交互应用提供了关于可解释性和可靠性的深入见解。

关键词

引用

@article{arxiv.2510.04484,
  title  = {Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness},
  author = {Amin Banayeeanzade and Ala N. Tak and Fatemeh Bahrani and Anahita Bolourani and Leonardo Blas and Emilio Ferrara and Jonathan Gratch and Sai Praneeth Karimireddy},
  journal= {arXiv preprint arXiv:2510.04484},
  year   = {2025}
}

备注

Submitted to ARR - October 2025