中文

大型语言模型策略推理能力的涌现

综合经济学 2025-10-23 v4 经济学

摘要

由于大型语言模型在结构化任务(例如编程和数学)中展现出了强大的推理能力,我们探索这些能力是否能扩展到策略性多智能体环境中。我们通过分析大型语言模型在行为经济学中三个经典博弈上的表现,研究了它们的策略推理能力——即通过预测和适应他人的行为来选择最优行动方案的过程。利用有限理性的层级模型,我们评估了三个标准 LLM(ChatGPT-4、Claude-3.5-Sonnet、Gemini 1.5)和三个推理 LLM(OpenAI-o1、Claude-4-Sonnet-Thinking、Gemini Flash Thinking 2.0)。我们的结果表明,推理 LLM 表现出优于标准 LLM(后者未表现出显著的策略推理能力)的策略推理能力,并且通常达到或超越人类水平;这代表了 LLM 策略推理能力中首个也是最根本的跨越。由于策略推理对未来 AI 系统(包括 Agentic AI)至关重要,我们的发现证明了专用推理能力在实现有效策略推理中的重要性。

关键词

引用

@article{arxiv.2412.13013,
  title  = {The Emergence of Strategic Reasoning of Large Language Models},
  author = {Gavin Kader and Dongwoo Lee},
  journal= {arXiv preprint arXiv:2412.13013},
  year   = {2025}
}