通过潜在特征驭控探索 LLM 的人格特质
计算与语言
2025-02-18 v2 人工智能
摘要
大型语言模型(LLM)通过其生成类人文本的能力在对话系统和角色扮演代理中取得了显著进展。尽管先前的研究表明 LLM 能够表现出distinct且一致的人格,但这些模型如何编码和表达特定人格特质的机制仍不为人所了解。为此,我们研究了各种因素(如文化规范和环境压力)如何通过编码于 LLM 中的因素来塑造其人格特质,基于社会决定论的理论框架。灵感来自 LLM 可解释性相关工作,我们提出了一种无需训练的方法,通过提取和驭控对应于模型中因素的潜在特征,从而修改模型的行为。此外,我们关注这些因素对模型安全的影响,通过人格的视角进行分析。
引用
@article{arxiv.2410.10863,
title = {Exploring the Personality Traits of LLMs through Latent Features Steering},
author = {Shu Yang and Shenzhe Zhu and Liang Liu and Lijie Hu and Mengdi Li and Di Wang},
journal= {arXiv preprint arXiv:2410.10863},
year = {2025}
}
备注
under review