中文

大型语言模型是战略决策者吗?关于两人零和博弈中性能与偏见的研究

人工智能 2024-10-16 v3 计算与语言 计算机科学与博弈论

摘要

大型语言模型 (LLM) 越来越多地被用于实际场景,但其战略决策能力仍鲜有探索。为了充分发挥 LLM 的潜力,关键是理解其在复杂社会情境中的功能。在博弈论已被用于理解现实世界互动的情况下,提供了评估这些能力的良好框架。本工作研究了 LLM 在经典博弈论两人零和博弈中的性能与价值,包括 Stag Hunt 和囚徒困境。我们对 GPT-3.5、GPT-4-Turbo、GPT-4o 和 Llama-3-8B 进行结构化评估,发现这些模型在这些博弈中作出决策时受到以下至少一种系统性偏见的影响:位置偏见、收益偏见或行为偏见。这表明 LLM 在作出这些战略决策时并不完全依赖逻辑推理。结果发现,LLM 在博弈配置与影响偏差不一致时性能下降。当不一致时,GPT-3.5、GPT-4-Turbo、GPT-4o 和 Llama-3-8B 在 Stag Hunt 中的平均性能下降分别为 32%、25%、34% 和 29%,在囚徒困境中的平均性能下降分别为 28%、16%、34% 和 24%。令人惊讶的是,GPT-4o(在标准基准测试中表现最好的 LLM)受到最严重的性能下降,表明新模型并未解决这些问题。有趣的是,我们发现改善 LLM 推理能力的常用方法——链律思考 (CoT) 提示——在 GPT-3.5、GPT-4o 和 Llama-3-8B 中减少了偏见,但在 GPT-4-Turbo 中增加了偏差的影响,表明 CoT 单独无法完全作为解决这一问题的稳健方法。我们进行了几项额外实验,这些实验进一步阐释了观察到的行为。

关键词

引用

@article{arxiv.2407.04467,
  title  = {Are Large Language Models Strategic Decision Makers? A Study of Performance and Bias in Two-Player Non-Zero-Sum Games},
  author = {Nathan Herr and Fernando Acero and Roberta Raileanu and María Pérez-Ortiz and Zhibin Li},
  journal= {arXiv preprint arXiv:2407.04467},
  year   = {2024}
}