外向还是内向?控制大语言模型人格的策略
计算与语言
2024-06-10 v1
摘要
大型语言模型(LLMs)在文本生成与理解方面展现出强大的能力,模仿人类行为并呈现出合成性人格。然而,一些LLMs已显示出冒犯性人格,传播有害话语。现有文献忽略了LLM人格的来源与演变,以及有效的人格控制方法。为填补这一空白,我们开展了全面的LLM人格控制研究。我们调查了多种影响LLMs的方法,包括三种训练方法:持续预训练(Continual Pre-training)、监督微调(Supervised Fine-Tuning, SFT)和基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF),以及推理阶段的注意事项(提示词)。我们的研究发现,控制效果呈层级结构:提示词 > SFT > RLHF > 持续预训练。值得注意的是,SFT的控制成功率高于提示词诱导。虽然提示词在有效性方面表现突出,但我们发现,提示词诱导的人格不如训练后人格稳健,在逆向人格提示词诱导下更容易显示出冲突性人格。除此之外,我们提出了结合SFT与提示词优势的策略:rompt nduction post upervised ine-tuning(PISF),其显示出控制LLMs人格最有效且最稳健的策略,展现出高效性、高成功率和高鲁棒性。在逆向人格提示词诱导情境下,由PISF控制的LLMs仍能表现出稳定且稳健的人格。
关键词
引用
@article{arxiv.2406.04583,
title = {Extroversion or Introversion? Controlling The Personality of Your Large Language Models},
author = {Yanquan Chen and Zhen Wu and Junjie Guo and Shujian Huang and Xinyu Dai},
journal= {arXiv preprint arXiv:2406.04583},
year = {2024}
}