中文

LLM是否展现出类人推理?评估LLM在开放式回答中的心智理论

计算与语言 2024-06-11 v1 人工智能

摘要

心智理论推理涉及认识到其他个体拥有自己的意图、情感和思想,这对于指导自身的思维过程至关重要。尽管大型语言模型在摘要、问答和翻译等任务中表现出色,但它们在心智理论推理方面仍面临挑战,尤其是在开放式问题中。尽管取得了进展,但在开放式场景中,LLM真正理解心智理论推理的程度以及它与人类心智理论推理的接近程度仍未得到充分探索。受这一差距的驱动,我们评估了LLM在开放式问题中感知和整合人类意图与情感进入其心智理论推理过程的能力。我们的研究利用了Reddit的ChangeMyView平台的帖子,这需要细致的社会推理来构建有说服力的回应。我们的分析比较了人类和LLM生成回应之间的语义相似性和词汇重叠指标,揭示了在开放式问题中心智理论推理能力的明显差异,即使是最先进的模型也显示出显著的局限性。为了增强LLM的能力,我们实施了一种提示调优方法,融入了人类意图和情感,从而改进了心智理论推理性能。然而,尽管有这些改进,增强效果仍未能完全实现类人推理。这项研究突出了LLM在社会推理中的缺陷,并展示了整合人类意图和情感如何提升其有效性。

关键词

引用

@article{arxiv.2406.05659,
  title  = {Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses},
  author = {Maryam Amirizaniani and Elias Martin and Maryna Sivachenko and Afra Mashhadi and Chirag Shah},
  journal= {arXiv preprint arXiv:2406.05659},
  year   = {2024}
}