人格作为大语言模型评估的探针:方法权衡与下游效应
计算与语言
2025-09-08 v1
摘要
大语言模型(LLMs)中的人格操控在客户服务和智能体场景中应用日益广泛,但其机制和权衡仍不明确。我们使用大五人格特质对人格控制进行了系统性研究,比较了上下文学习(ICL)、参数高效微调(PEFT)和机制性引导(MS)。我们的贡献有四个方面。首先,我们构建了一个包含平衡的高/低特质响应的对比数据集,从而能够进行有效的引导向量计算和公平的跨方法评估。其次,我们引入了一个基于运行内分析的统一评估框架,该框架在MMLU、GAIA和BBQ基准上解耦了推理能力、智能体性能和人口统计学偏见。第三,我们开发了特质纯化技术,将开放性从尽责性中分离出来,解决了特质编码中的表征重叠问题。第四,我们提出了一个三级稳定性框架,量化了方法、特质和组合层面的鲁棒性,为部署约束下的实践提供了指导。在Gemma-2-2B-IT和LLaMA-3-8B-Instruct上的实验揭示了明确的权衡:ICL实现了强对齐且能力损失最小,PEFT以牺牲任务性能为代价提供了最高的对齐度,而MS则以具有竞争力的有效性提供了轻量级的运行时控制。特质层面的分析显示,开放性具有独特的挑战性,宜人性对ICL最具抵抗力,并且人格编码在中间层周围巩固。综上所述,这些结果将人格操控确立为一种多层级的行为表征探针,连接了表面条件化、参数编码和激活级引导,并将机制性引导定位为一种在部署和可解释性方面均可替代微调的轻量级方案。
引用
@article{arxiv.2509.04794,
title = {Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects},
author = {Gunmay Handa and Zekun Wu and Adriano Koshiyama and Philip Treleaven},
journal= {arXiv preprint arXiv:2509.04794},
year = {2025}
}