中文

用于评估大语言模型战略推理的多智能体宝可梦锦标赛

人工智能 2025-08-05 v1

摘要

本研究提出了 LLM 宝可梦联盟 (LLM Pokemon League),这是一套基于大语言模型 (LLM) 作为智能代理,以模拟宝可梦战斗中战略决策的竞争性锦标赛系统。该平台旨在分析和比较不同大语言模型在基于类型、回合制作战环境中所展现的推理能力、适应性和战术深度。通过将竞赛结构为单淘汰赛制,涉及多样化 AI 教练,系统捕获详细的决策日志,包括队伍构建理由、行动选择策略以及换队决策。该项目 enables 对比较型 AI 行为、战斗心理学以及受限、规则驱动游戏环境中的元策略发展进行深入探索。通过该系统,我们研究现代大语言模型在不确定性下如何理解、适应和优化决策,使宝可梦联盟成为战略推理和竞争学习领域的新型基准。

关键词

引用

@article{arxiv.2508.01623,
  title  = {A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models},
  author = {Tadisetty Sai Yashwanth and Dhatri C},
  journal= {arXiv preprint arXiv:2508.01623},
  year   = {2025}
}