中文

CivRealm: 面向决策智能体的文明学习与推理奥德赛

人工智能 2024-03-13 v2

摘要

决策智能体的泛化包含两个基本要素:从过往经验中学习以及在新颖情境中推理。然而,大多数交互环境主要侧重于学习,往往以牺牲推理的复杂性为代价。在本文中,我们介绍了受《文明》游戏启发的环境 CivRealm。《文明》与人类历史和社会的深度契合要求复杂的学习,而其不断变化的局势则需要强大的推理能力以实现泛化。特别是,CivRealm 设定了一个玩家数量可变的不完全信息一般和博弈;它呈现了大量复杂特征,挑战智能体在需要外交和谈判技巧的开放式随机环境中进行应对。在 CivRealm 中,我们提供了两类典型智能体的接口:侧重学习的基于张量的智能体和强调推理的基于语言的智能体。为了推动进一步研究,我们给出了这两种范式的初步结果。标准的基于 RL 的智能体在小游戏中表现出合理的性能,而基于 RL 和 LLM 的智能体在完整游戏中均难以取得实质性进展。总体而言,CivRealm 对决策智能体构成了独特的学习与推理挑战。代码可在 https://github.com/bigai-ai/civrealm 获取。

关键词

引用

@article{arxiv.2401.10568,
  title  = {CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents},
  author = {Siyuan Qi and Shuo Chen and Yexin Li and Xiangyu Kong and Junqi Wang and Bangcheng Yang and Pring Wong and Yifan Zhong and Xiaoyuan Zhang and Zhaowei Zhang and Nian Liu and Wei Wang and Yaodong Yang and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:2401.10568},
  year   = {2024}
}