中文

ZSC-Eval:一种用于多智能体零样本协同的评估工具包与基准

人工智能 2024-09-27 v3 人机交互 机器学习 多智能体系统

摘要

零样本协同(ZSC)是一项新的合作式多智能体强化学习(MARL)挑战,旨在训练一个自我智能体在部署期间与多样且未见的伙伴协作。部署时伙伴分布与由训练算法决定的训练伙伴分布之间的显著差异,使ZSC成为一种独特的分布外(OOD)泛化挑战。评估与部署时伙伴之间潜在的分布差距导致评估不充分,而适当评估指标的缺乏加剧了这一问题。本文提出ZSC-Eval,首个面向ZSC算法的评估工具包与基准。ZSC-Eval包括:1)通过行为偏好奖励生成评估伙伴候选以近似部署时伙伴分布;2)通过最佳响应多样性(BR-Div)筛选评估伙伴;3)利用最佳响应接近度(BR-Prox)指标衡量与各类评估伙伴的泛化性能。我们使用ZSC-Eval在Overcooked和Google Research Football环境中对ZSC算法进行基准测试,获得了新的实证发现。我们还对当前ZSC算法开展了人类实验,以验证ZSC-Eval与人类评估的一致性。ZSC-Eval现已发布于 https://github.com/sjtu-marl/ZSC-Eval。

关键词

引用

@article{arxiv.2310.05208,
  title  = {ZSC-Eval: An Evaluation Toolkit and Benchmark for Multi-agent Zero-shot Coordination},
  author = {Xihuai Wang and Shao Zhang and Wenhao Zhang and Wentao Dong and Jingxiao Chen and Ying Wen and Weinan Zhang},
  journal= {arXiv preprint arXiv:2310.05208},
  year   = {2024}
}

备注

Accepted in NeurIPS 2024 Dataset and Benchmark Track