AI玩商业游戏:在动态模拟中基准测试大语言模型的管理决策能力
人工智能
2025-10-01 v1
摘要
大语言模型(LLMs)的快速发展引发了人们对其增强或自动化管理职能潜力的浓厚兴趣。AI基准测试的最新趋势之一是大语言模型在更长时间跨度上的表现。虽然LLMs在涉及自然语言和模式识别的任务中表现出色,但它们在多步骤、战略性商业决策方面的能力在很大程度上仍未得到探索。很少有研究表明,结果可能与短期任务中的基准测试结果不同,正如Vending-Bench所揭示的那样。与此同时,用于评估长期一致性的替代基准也很缺乏。本研究分析了一个使用商业游戏进行商业决策的新颖基准。该研究通过向研究界提出一个可复现、开放获取的管理模拟器用于LLM基准测试,为AI领域的最新文献做出了贡献。这个新颖的框架被用于评估五个在免费在线接口中可用的领先LLM的性能:Gemini、ChatGPT、Meta AI、Mistral AI和Grok。LLM为一个模拟的零售公司做出决策。一个动态的、逐月进行的管理模拟在电子表格模型中透明地提供了实验环境。在十二个月中的每一个月,LLM都会收到一个包含上一期完整业务报告的结构化提示,并负责做出关键的战略决策:定价、订单量、营销预算、招聘、解雇、贷款、培训费用、研发费用、销售预测、收入预测。该方法旨在比较LLM在利润、收入、市场份额和其他KPI等定量指标上的表现。LLM的决策会从战略一致性、对市场变化的适应性以及为其决策提供的理由等方面进行分析。这种方法使我们能够超越简单的性能指标,来评估长期决策能力。
引用
@article{arxiv.2509.26331,
title = {AI Playing Business Games: Benchmarking Large Language Models on Managerial Decision-Making in Dynamic Simulations},
author = {Berdymyrat Ovezmyradov},
journal= {arXiv preprint arXiv:2509.26331},
year = {2025}
}
备注
34 pages, 7 figures, 3 tables