中文

UrzaGPT:用于集换式卡牌游戏中卡牌选择的 LoRA 微调大语言模型

人工智能 2025-08-13 v1

摘要

集换式卡牌游戏(CCG)因其部分可观测性、长期决策制定以及不断演变的卡牌池,对人工智能而言是一个困难的类型。因此,当前的 AI 模型在诸如构筑牌组和游戏玩法等 CCG 任务上的表现远逊于人类玩家。在这项工作中,我们介绍了 UrzaGPT,这是一个领域自适应的大语言模型,可为《万智牌》中的实时选牌决策提供建议。从一个开放权重的大语言模型(LLM)出发,我们在一个带有注释的选牌日志数据集上使用低秩适应(Low-Rank Adaptation)进行微调。借此,我们利用了大语言模型的语言建模能力,并能快速适应游戏的不同扩展系列。我们将 UrzaGPT 与零样本大语言模型和最先进的领域特定模型进行了基准比较。未经微调的小型大语言模型(如 Llama-3-8B)完全无法进行选牌,但较大的 GPT-4o 达到了 43% 的零样本性能。使用 UrzaGPT 微调较小模型,仅用 10,000 步就达到了 66.2% 的准确率。尽管这尚未达到领域特定模型的能力,但我们证明了仅使用大语言模型进行选牌是可行的,并得出结论:使用大语言模型可以在未来实现高性能、通用且易于更新的选牌人工智能。

关键词

引用

@article{arxiv.2508.08382,
  title  = {UrzaGPT: LoRA-Tuned Large Language Models for Card Selection in Collectible Card Games},
  author = {Timo Bertram},
  journal= {arXiv preprint arXiv:2508.08382},
  year   = {2025}
}