Digital Player:评估游戏中基于大语言模型的类人智能体
机器学习
2025-03-03 v1
摘要
随着大语言模型(LLMs)的快速发展,基于 LLM 的自主智能体已展现出作为数字员工(如数字分析师、教师和程序员)的潜力。在本文中,我们基于拥有数百万活跃玩家的开源策略游戏“Unciv”开发了一个应用级测试平台,使研究人员能够构建“数据飞轮”,以研究“数字玩家”任务中的类人智能体。这款类似《文明》的游戏具有广阔的决策空间以及丰富的语言交互(如外交谈判和欺骗行为),对基于 LLM 的智能体在数值推理和长期规划方面提出了重大挑战。“数字玩家”的另一个挑战是生成类人的回应,以便与人类玩家进行社交互动、协作和谈判。该开源项目可在 https:/github.com/fuxiAIlab/CivAgent 找到。
引用
@article{arxiv.2502.20807,
title = {Digital Player: Evaluating Large Language Models based Human-like Agent in Games},
author = {Jiawei Wang and Kai Wang and Shaojie Lin and Runze Wu and Bihan Xu and Lingeng Jiang and Shiwei Zhao and Renyu Zhu and Haoyu Liu and Zhipeng Hu and Zhong Fan and Le Li and Tangjie Lyu and Changjie Fan},
journal= {arXiv preprint arXiv:2502.20807},
year = {2025}
}
备注
neurips datasets and benchmarks 2024, not accepted