中文

LUDOBENCH:通过Ludo中的基于spot的棋盘游戏情景评估LLM行为决策

人工智能 2026-04-08 v1 计算与语言 计算机科学与博弈论 机器学习 多智能体系统

摘要

我们提出LudoBench,这是一个用于评估LLM在Ludo中的战略推理的基准测试。Ludo是一种随机多智能体棋盘游戏,其掷骰子机制、棋子俘获、安全方格导航和回家路径推进引入了有意义的规划复杂度。LudoBench包含480个手工制作的spot情景,分为12个行为上不同的决策类别,每个类别都隔离了特定的战略选择。我们 additionally贡献了一个完全功能的4玩家Ludo模拟器,支持Random、Heuristic、Game-Theory和LLM智能体。游戏论智能体使用Expectiminimax搜索进行深度受限的前瞻,以提供原则性的战略天花板,超越贪婪式启发式方法。评估覆盖六个模型(跨越四个模型家族),我们发现所有模型仅在40-46%的时间与游戏论基线一致。模型分为不同的行为原型:完成者完成棋子但忽视发展,建造者发展但永远不会完成。每个原型仅捕获游戏论策略的一半。模型还在历史条件化的怨恨框架下对相同棋盘状态显示出可测量的行为偏移,这揭示了prompt敏感性是一个关键脆弱性。LudoBench提供了一个轻量且可解释的框架,用于在不确定性下对LLM战略推理进行基准测试。所有代码、spot数据集(480条)和模型输出均可在https://anonymous.4open.science/r/LudoBench-5CBF/获取。

关键词

引用

@article{arxiv.2604.05681,
  title  = {LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo},
  author = {Ojas Jain and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2604.05681},
  year   = {2026}
}

备注

Under Review