大型语言模型中个人价值表达的稳定性
摘要
研究大型语言模型(LLM)的标准方法是提供来自类似最小语境(如多选题)的多个不同查询。然而,由于 LLM 高度依赖语境,此类最小语境评估所得的结论可能对模型在实际部署时(将面临许多新语境)的行为信息有限。我们认为,语境依赖性( Specifically,价值稳定性)应作为 LLM 的特定属性进行研究,并用作 LLM 比较的另一维度(除认知能力、知识或模型规模外)。我们提出了关于 LLM 在不同语境下(模拟不同主题的对话)中价值表达稳定性的案例研究,通过标准心理学问卷(PVQ)以及行为下游任务进行测量。我们重用心理学中的方法,研究在群体( interpersonal)层面的排序稳定性,以及在个体( intrapersonal)层面的 Ipsative 稳定性。我们考虑两种设置(有无指示 LLM 模拟特定人格),以及两种模拟人群和三个下游任务。我们观察到模型和模型家族(如Mixtral、Mistral、GPT-3.5和Qwen)在稳定性方面优于LLaMa-2和Phi。这些趋势的一致性表明,某些模型 exhibits 较高的价值稳定性,而且可以使用所引入的方法ological 工具进行估计。在被指示模拟特定人格时,LLM exhibits 较低的排序稳定性,这进一步随对话长度的增加而下降。这进一步凸显了未来研究 LLM 能够稳健地模拟不同人格的必要性。本文为此方向的研究提供了基础性步骤,并在我们所知范围内是价值稳定性研究在 LLM 中的第一篇工作。
引用
@article{arxiv.2402.14846,
title = {Stick to your Role! Stability of Personal Values Expressed in Large Language Models},
author = {Grgur Kovač and Rémy Portelas and Masataka Sawayama and Peter Ford Dominey and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2402.14846},
year = {2024}
}
备注
The project website and code are available at https://sites.google.com/view/llmvaluestability Published in PLOS ONE ( https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0309114 ), and a shorter version at CogSci 24 ( https://escholarship.org/uc/item/7w4823c6 )