迷你游乐场 (MAPs):用于建模商业决策的测试平台
人工智能
2025-11-21 v1
摘要
尽管人工智能领域取得了快速进展,当前系统在构成现实决策中相互交织挑战方面仍感到困境。商业管理等实际领域需要在开放性且多方面目标的优化基础上,从稀疏经验中主动学习环境动态,在随机环境中进行长期规划,并进行空间信息推理。然而,现有的人类-AI基准测试只孤立地测试这些能力的子集,限制了我们对整体决策能力的评估。我们引入迷你游乐场 (MAPs),一个游乐园模拟器,旨在评估智能体建模其环境、在不确定性下预期长期后果以及以战略方式运营复杂商业的能力。我们提供了人类基准并对最新大语言模型 (LLM) 智能体进行了全面评估,发现人类在简单模式下以 6.5 倍、中等模式下以 9.8 倍的性能优于这些系统。我们的分析揭示了在长期优化、样本高效学习、空间推理和世界建模方面存在持久性弱点。通过将这些挑战统一于单个环境中,MAPs 提供了一个新的基准平台,用于评估具备可适应决策能力的智能体。代码:https://github.com/Skyfall-Research/MAPs
引用
@article{arxiv.2511.15830,
title = {Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions},
author = {Stéphane Aroca-Ouellette and Ian Berlot-Attwell and Panagiotis Lymperopoulos and Abhiramon Rajasekharan and Tongqi Zhu and Herin Kang and Kaheer Suleman and Sam Pasupalak},
journal= {arXiv preprint arXiv:2511.15830},
year = {2025}
}
备注
8 pages (main paper)