从文本到表情符号:PEFT 驱动的人格操控如何释放 LLM 中的表情符号潜力
计算与语言
2025-02-26 v4
摘要
大语言模型(LLM)人格特质的操控已成为一个关键研究领域。基于提示的上下文知识编辑(IKE)和基于梯度的模型编辑网络(MEND)等方法已被探索,但表现出不规则性和多变性;IKE 依赖于提示,导致多变性和敏感性,而 MEND 产生不一致且无意义的输出。为了解决这个问题,我们采用了基于观点问答的参数高效微调(PEFT),特别是量化低秩适应(QLoRA),来操控大五人格特质:开放性、尽责性、外向性、宜人性和神经质。在 PEFT 之后,Mistral-7B-Instruct 和 LLaMA-2-7B-chat 等模型表现出一种潜在行为,即为某些特质生成表情符号,尽管 PEFT 数据中不存在表情符号。例如,LLaMA-2-7B-chat 在 99.5% 的外向性相关测试实例中生成了表情符号,而 Mistral-7B-Instruct 在 92.5% 的开放性相关测试实例中也是如此。ICL 可解释性分析表明,LLM 有意使用表情符号来表达这些特质。机制可解释性分析显示,LLM 的这种潜在行为可以追溯到在 PEFT 后被激活或放大的特定神经元。本文提供了多项新颖贡献:首先,引入了用于 PEFT 驱动人格操控的观点问答数据集;其次,开发了用于对 LLM 人格特质进行基准测试的指标模型;第三,证明了 PEFT 在人格操控上优于 IKE;最后,通过机制可解释性和上下文学习可解释性等可解释性方法分析并验证了表情符号的使用。
引用
@article{arxiv.2409.10245,
title = {From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMs},
author = {Navya Jain and Zekun Wu and Cristian Munoz and Airlie Hilliard and Xin Guan and Adriano Koshiyama and Emre Kazim and Philip Treleaven},
journal= {arXiv preprint arXiv:2409.10245},
year = {2025}
}
备注
Findings paper of NAACL 2025 and NeurIPS 2024 Workshop on Behavioral Machine Learning