评估大型语言模型作为即时战略代理:供应商表现、混合分解及计时风险游戏中的运营差距
人工智能
2026-05-22 v1
摘要
静态基准仅捕捉大型语言模型在实际场景中行为的部分内容。真实系统将模型置于具有时间限制、格式约束和故障模式的循环中。我们在具有明确胜利目标和重复规划执行周期的计时 Risk 环境中研究此设置。在冻结规则下的复制 32 场跨供应商锦标赛中,gemini-3.1-pro-preview 以 20 胜 32 场的成绩击败 gpt-5.1、claude-opus-4-7 和 kimi-k2.6,汇集的获胜分布与等效强度空投 (p 约 1.5 x 10^-5) 显著不同。我们随后通过标准化执行使用更便宜的 Gemini Flash 底层架构来分离规划与执行。在此设计下,32 场规划烤赛与接近平等 (p 约 0.821) 一致,这表明此前的供应商差异大部分来自端到端系统行为而非单纯的规划能力。为研究机制,我们分析了来自供应商锦标赛的保存规划和执行轨迹。Gemini 更频繁地引用终端目标,随着胜利逼近而增加这种关注。Gemini 还将更多回合转换为深层征服链,尽管其运行时并非最干净。这表明即时代理性能取决于目标跟踪、执行转换、成本和运行可靠性,并支持将 LLM 评估为受限工作流程中的组件,而非孤立的基准响应者。
引用
@article{arxiv.2605.22238,
title = {Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play},
author = {H. C. Ekne},
journal= {arXiv preprint arXiv:2605.22238},
year = {2026}
}
备注
13 pages, 7 figures. Code and tracked notes: https://github.com/hcekne/risk-game . Public runtime artifact index: https://github.com/hcekne/risk-game/blob/main/docs/article-plans/public_experiment_artifacts.md