PTCG-Bench:LLM 智能体是否能掌握宝可梭卡牌游戏?
人工智能
2026-05-29 v1
摘要
在面对具有战略复杂性的棋盘游戏时,人类玩家可以在几轮游戏后迅速学习制定策略。然而,现有智能体基准往往未能完全捕捉此类战略和动态决策情景。我们提出PTCG-Bench,基于宝可梭卡牌游戏(PTCG)构建的基准,评估 LLM 智能体在两个互补层面:(1)其在单个复杂环境中的决策表现,(2)其通过累积经验实现的自我演化能力。我们进一步包括一个模块化的托架消除,以更好地解释智能体表现,而不将其与模型能力混为一谈。我们的实验表明,尽管 LLM 智能体可实现非平凡的游戏表现,但持续稳定的自我演化仍具有挑战性,且表现对托架设计敏感。我们希望PTCG-Bench将促进面向托架感知和自我演化智能体在真实交互环境中的未来研究。
关键词
引用
@article{arxiv.2605.29653,
title = {PTCG-Bench: Can LLM Agents Master Pok\'emon Trading Card Game?},
author = {Dongdong Hua and Yifei Sun and Renhong Huang and Feng Gao and Chunping Wang and Yang Yang},
journal= {arXiv preprint arXiv:2605.29653},
year = {2026}
}