大语言模型能否在「Ăn Quân」游戏中发挥作用?多步规划与决策制定研究
计算与语言
2025-07-10 v3
摘要
本文通过传统越南棋盘游戏「Ăn Quân」的视角,探讨大语言模型(LLMs)进行规划与决策的能力。该游戏涉及一系列战略性的令牌移动与抢夺,为评估 LLMs 的决策与战略能力提供了独特的环境。具体而言,我们开发了各种智能体人格,从积极攻击到防御为止,并将「Ăn Quân」游戏作为测试台,评估 LLMs 在不同策略下的表现。通过实验 Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct 和 Llama-3.3-70B-Instruct 等模型,旨在理解这些模型如何执行战略决策、规划移动并管理动态游戏状态。结果将为了解 LLMs 在推理与战略方面的优势与不足提供深入见解,进而加深对其通用能力的理解。
引用
@article{arxiv.2507.03711,
title = {Can LLMs Play \^O \u{A}n Quan Game? A Study of Multi-Step Planning and Decision Making},
author = {Sang Quang Nguyen and Kiet Van Nguyen and Vinh-Tiep Nguyen and Thanh Duc Ngo and Ngan Luu-Thuy Nguyen and Duy-Dinh Le},
journal= {arXiv preprint arXiv:2507.03711},
year = {2025}
}
备注
Accepted paper at MAPR 2025