中文

Orak:用于在多样化视频游戏中训练和评估LLM智能体的基础基准

人工智能 2026-04-16 v3

摘要

大语言模型(LLM)智能体正在重塑游戏行业,使角色更加智能且更受玩家青睐。然而,当前的游戏基准测试未能满足实际需求:它们缺乏对不同游戏类型中LLM多种能力的评估、对复杂游戏玩法至关重要的智能体模块的研究,以及将预训练LLM适配为游戏智能体的微调数据集。为了填补这些空白,我们提出了Orak,一个涵盖12款热门视频游戏(覆盖所有主要类型)的LLM智能体训练与评估基准。基于模型上下文协议(MCP)构建的即插即用接口,使Orak能够支持对不同游戏场景中智能体模块的系统化和可复现研究。我们还发布了一个涵盖多种类型的专家LLM游戏轨迹微调数据集,将通用LLM转化为有效的游戏智能体。Orak提供了一个统一的评估框架,包括游戏排行榜、LLM对战竞技场,以及对输入模态、智能体策略和微调效果的消融研究,为构建通用游戏智能体奠定了基础。代码和数据集可在 https://github.com/krafton-ai/Orak 和 https://huggingface.co/datasets/KRAFTON/Orak 获取。

关键词

引用

@article{arxiv.2506.03610,
  title  = {Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games},
  author = {Dongmin Park and Minkyu Kim and Beongjun Choi and Junhyuck Kim and Keon Lee and Jonghyun Lee and Inkyu Park and Byeong-Uk Lee and Jaeyoung Hwang and Jaewoo Ahn and Ameya S. Mahabaleshwarkar and Bilal Kartal and Pritam Biswas and Yoshi Suhara and Kangwook Lee and Jaewoong Cho},
  journal= {arXiv preprint arXiv:2506.03610},
  year   = {2026}
}