中文

超越规模:评估LLM在零和环境中的战略推理与快速决策能力

计算机视觉与模式识别 2026-03-11 v1 人工智能

摘要

大语言模型(LLMs)在静态推理基准上取得了强大的性能,但其作为在对抗性、时间敏感环境中互动智能体的有效性仍不为人知。现有评估大体上将推理视为单次能力,忽略了对对手意识决策、时间限制以及压力下执行的挑战。本文引入了战略战术智能体推理(STAR)基准测试,构建一个通过1v1零和竞争互动评估LLMs的多智能体评估框架,将推理建模为迭代、自适应的决策过程。STAR支持轮次制和实时设置,使我们能够在统一环境中受控地分析长期战略规划和高速战术执行。基于模块化架构、标准化API和完全实现的执行引擎,STAR促进了可重复的评估和灵活的任务定制。为超越二元输赢结果,我们引入了战略评估套件,评估不仅包括竞争成功,还包括战略行为质量,如执行效率和结果稳定性。广泛的成对评估揭示了显著的策略-执行差距:尽管推理密集型模型在轮次制设置中占据主导地位,但其推理延迟常常导致在实时场景中的表现不佳,此时更快的指令调优模型占据优势。这些结果表明,交互式环境中的战略智能不仅取决于推理深度,还取决于将计划转化为及时行动的能力,STAR作为一种原则性基准,适用于研究这一竞争性动态环境中的这一权衡。

关键词

引用

@article{arxiv.2603.09337,
  title  = {Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments},
  author = {Yang Li and Xing Chen and Yutao Liu and Gege Qi and Yanxian BI and Zizhe Wang and Yunjian Zhang and Yao Zhu},
  journal= {arXiv preprint arXiv:2603.09337},
  year   = {2026}
}

备注

Code available