中文

基于因果强化学习的复杂卡牌游戏:Magic The Gathering 基准

机器学习 2026-05-08 v1 人工智能

摘要

因果强化学习(RL)缺乏复杂系统的基准测试,这些系统综合了顺序决策、隐藏信息、大型掩码动作空间以及显式因果结构。我们引入MTG-Causal-RL,这是一个建立在Magic: The Gathering之上的Gymnasium基准,包含3077维部分观测、478维掩码离散动作空间、五种竞争Standard格式、三个奖励方案,以及针对战略变量的手工指定结构因果模型(SCM)。每个episode公开因果变量、SCM预测的干预效应以及每个因子的信用轨迹,使因果信用分配、leave-one-out跨格式迁移和策略可审计性成为一等级指标。我们调整了一组参考基线:随机、启发式、掩码PPO、因果世界模型PPO变体以及与架构匹配的标量控制。我们提出Causal Graph-Factored Advantage PPO(CGFA-PPO)作为参考因果智能体,该智能体使用SCM胜率概率的父节点的因子对齐评论家目标,并应用干预校准损失。所有比较均使用配对随机种子、配对-bootstrap置信区间以及预先登记的家族中的Holm-Bonferroni校正。掩码PPO和CGFA-PPO在分布内赢得率达到竞争水平,超过随机基线;每个因子校准轨迹和leave-one-out迁移间隙揭示了标量赢得率无法呈现的诊断结构。我们公开发布基准、参考基线结果以及完整评估协议。通过将战略丰富、部分观测的领域与显式因果接口和统计协议耦合,MTG-Causal-RL为因果RL、世界模型和LLM代理研究提供了共享测试平台,能够提出当前基准无法提出的问题:在掩码动作空间下进行因果信用分配、跨格式的结构迁移以及基于SCM的策略可审计性。

关键词

引用

@article{arxiv.2605.06066,
  title  = {Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark},
  author = {Cristiano da Costa Cunha and Ajmal Mian and Tim French and Wei Liu},
  journal= {arXiv preprint arXiv:2605.06066},
  year   = {2026}
}

备注

21 pages, 8 figures, 9 tables, 1 algorithm