融合大语言模型与图注意力的资源受限亚马逊棋决策框架
摘要
人工智能通过智能博弈系统的发展取得了显著进步,这些系统为决策制定、战略规划和自适应学习提供了严格的测试平台。然而,资源受限的环境带来了严峻挑战,因为传统的深度学习方法严重依赖大量的数据集和计算资源。在本文中,我们为亚马逊棋提出了一种轻量级混合框架,该框架通过整合基于图学习的结构推理与大语言模型的生成能力,探索了弱到强泛化的范式。具体来说,我们利用图注意力自编码器为多步蒙特卡洛树搜索提供信息,利用随机图遗传算法优化评估信号,并利用 GPT-4o-mini 生成合成训练数据。与依赖专家演示的传统方法不同,我们的框架从嘈杂且不完美的监督中学习。我们证明了图注意力机制有效地充当了结构滤波器,对 LLM 的输出进行去噪。在 10×10 亚马逊棋盘上的实验表明,我们的混合方法不仅在决策准确性上比基线提高了 15%–56%,而且显著优于其教师模型 (GPT-4o-mini),在 N=30 节点时达到了 45.0% 的竞争性胜率,在仅 N=50 节点时达到了决定性的 66.5% 胜率。这些结果验证了在严格的计算约束下,从通用基础模型演化出专门的、高性能的游戏 AI 的可行性。
引用
@article{arxiv.2603.10512,
title = {Resource-constrained Amazons chess decision framework integrating large language models and graph attention},
author = {Tianhao Qian and Zhuoxuan Li and Jinde Cao and Xinli Shi and Leszek Rutkowski},
journal= {arXiv preprint arXiv:2603.10512},
year = {2026}
}
备注
20 pages, 15 figures. Supported by the National Key Research and Development Project of China (No. 2020YFA0714300), NSFC (No. 61833005, 12061088), the Open Project of Key Laboratory of Transport Industry of Comprehensive Transportation Theory (Nanjing Modern Multimodal Transportation Laboratory) (MTF2023004), and the China Postdoctoral Science Foundation (2024T170129, GZC20240261)