MineLand:模拟具有有限多模态感知与物理需求的大规模多智能体交互
计算与语言
2024-05-24 v2 人工智能
摘要
尽管视觉语言模型(VLM)在需要广泛协作的任务中具有广阔前景,但传统的多智能体模拟器已经促进了对反映集体行为的交互式人工社会的丰富探索。然而,现有的这些模拟器面临重大局限性。首先,由于资源需求高,它们难以处理大量智能体。其次,它们通常假设智能体拥有完美信息和无限能力,阻碍了模拟社会互动的生态效度。为了弥补这一差距,我们提出了一款多智能体 Minecraft 模拟器 MineLand,通过引入三个关键特征来弥补这一差距:大规模可扩展性、有限的多模态感知和物理需求。我们的模拟器支持 64 个或更多智能体。智能体具有有限的视觉、听觉和环境感知,迫使它们积极沟通和协作以满足食物和资源等物理需求。此外,我们进一步引入了受多任务理论启发的 AI 智能体框架 Alex,使智能体能够处理复杂的协调和调度。我们的实验表明,该模拟器、相应的基准测试和 AI 智能体框架有助于产生更具生态效度和更细致的集体行为。MineLand 和 Alex 的源代码已在 https://github.com/cocacola-lab/MineLand 开源。
引用
@article{arxiv.2403.19267,
title = {MineLand: Simulating Large-Scale Multi-Agent Interactions with Limited Multimodal Senses and Physical Needs},
author = {Xianhao Yu and Jiaqi Fu and Renjia Deng and Wenjuan Han},
journal= {arXiv preprint arXiv:2403.19267},
year = {2024}
}
备注
Project website: https://github.com/cocacola-lab/MineLand