中文

幽灵学习环境:空间与时间上的信念追踪

人工智能 2026-03-12 v2 机器学习 多智能体系统

摘要

与未知合作伙伴合作是合作人工智能中的核心挑战,通常以零射时协调(Zero-shot Coordination, ZSC)形式加以研究,通过衡量独立训练智能体在配对后的性能来评估算法。虽然曼哈ogan学习环境(Hanabi Learning Environment, HLE)已成为ZSC的主导基准,但近期研究在跨种子交叉对战中实现了近乎完美的性能,限制了其跟踪算法进展的能力。我们引入了幽灵学习环境(Yokai Learning Environment, YLE)——一个开源的多智能体强化学习基准测试,其中有效协作需要通过追踪和更新移动卡牌上的信念、在模糊提示下进行推理,以及基于推断的共享知识决定何时终止游戏——这些特征在HLE中不存在,其中信念与手牌位于固定位置,提示信息按规则为真。我们评估了领先的ZSC方法,包括High-Entropy IPPO、Other-Play和Off-Belief Learning,这些方法在HLE中实现了近乎完美的跨种子交叉对战性能,并显示在YLE中它们表现出持续的SP-XP差距、早期终止校准下降以及跨对战中的信念表示较弱,表明它们未能与未遇到的合作伙伴维持一致的内部模型。在HLE中表现最好的方法在YLE中并不一定表现最佳,表明在单个基准上衡量的进展可能无法概括。总之,这些结果确立了YLE作为一个具有挑战性的新型ZSC基准。

关键词

引用

@article{arxiv.2508.12480,
  title  = {The Yokai Learning Environment: Tracking Beliefs Over Space and Time},
  author = {Constantin Ruhdorfer and Matteo Bortoletto and Johannes Forkel and Jakob Foerster and Andreas Bulling},
  journal= {arXiv preprint arXiv:2508.12480},
  year   = {2026}
}

备注

A previous version was presented as an oral presentation at the the ToM IJCAI 2025 Workshop