中文

当“一个有用的助手”并非真正有用:系统提示中的人格设定并不能提升大语言模型表现

计算与语言 2024-10-10 v3 人工智能 计算机与社会 人机交互 机器学习

摘要

提示(Prompting)是人类与大语言模型(LLM)交互的主要方式。商业 AI 系统通常在系统提示中定义 LLM 的角色。例如,ChatGPT 使用“你是一个有用的助手”作为其默认系统提示的一部分。尽管当前有在系统提示中添加人格设定(persona)的做法,不同人格设定如何影响模型在客观任务上的表现仍不清楚。在本研究中,我们提出了对系统提示中人格设定的系统性评估。我们整理了一份包含 162 个角色的列表,涵盖 6 种人际关系类型和 8 个专业领域。通过对 4 个流行 LLM 系列和 2410 个事实性问题的广泛分析,我们证明与不添加任何人格设定的对照设置相比,在系统提示中添加人格设定并未在一系列问题上改善模型表现。然而,进一步分析表明,人格设定的性别、类型和领域都会影响最终的预测准确率。我们进一步尝试了一系列人格设定搜索策略,发现虽然对每个问题聚合最佳人格设定的结果能显著提升预测准确率,但自动识别最佳人格设定具有挑战性,预测表现往往不优于随机选取。总体而言,我们的发现表明,尽管在某些设置下添加人格设定可能带来性能提升,但各人格设定的效果在很大程度上可能是随机的。代码和数据可在 https://github.com/Jiaxin-Pei/Prompting-with-Social-Roles 获取。

关键词

引用

@article{arxiv.2311.10054,
  title  = {When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models},
  author = {Mingqian Zheng and Jiaxin Pei and Lajanugen Logeswaran and Moontae Lee and David Jurgens},
  journal= {arXiv preprint arXiv:2311.10054},
  year   = {2024}
}

备注

Accepted by Findings of EMNLP 2024