中文

通过提示工程提升大语言模型的心理理论推理性能

人工智能 2023-04-27 v3 计算与语言

摘要

大语言模型(LLMs)在2023年的许多任务中表现出色,但在复杂推理方面仍面临挑战。心理理论(ToM)任务要求理解智能体的信念、目标和心理状态,对于涉及人类的常识推理至关重要,因此提升LLM在该领域的能力十分关键。本研究测量了GPT-4和三种GPT-3.5变体(Davinci-2、Davinci-3、GPT-3.5-Turbo)的ToM性能,并探讨了上下文学习在提升其ToM理解能力方面的有效性。我们评估了采用两样本思维链推理和逐步思考指令的提示。我们发现,使用基于人类反馈的强化学习(RLHF)训练的LLM(除Davinci-2外的所有模型)通过上下文学习提升了其ToM准确率。GPT-4在零样本设置下表现最佳,达到近80%的ToM准确率,但仍低于测试集上87%的人类准确率。然而,当提供用于上下文学习的提示时,所有经RLHF训练的LLM的ToM准确率均超过80%,其中GPT-4达到100%。这些结果表明恰当的提示能增强LLM的ToM推理,并凸显了LLM认知能力的上下文依赖特性。

关键词

引用

@article{arxiv.2304.11490,
  title  = {Boosting Theory-of-Mind Performance in Large Language Models via Prompting},
  author = {Shima Rahimi Moghaddam and Christopher J. Honey},
  journal= {arXiv preprint arXiv:2304.11490},
  year   = {2023}
}

备注

27 pages, 4 main figures, 2 supplementary figures