中文

探测合作 MARL 中的 Dec-POMDP 推理

机器学习 2026-02-25 v1 多智能体系统

摘要

合作多智能体强化学习(MARL)通常被建模为 decentralized partially observable Markov decision process(Dec-POMDP),其困难性源于两个关键挑战:部分可观测性和去中心化协调。真正解决此类任务需要 Dec-POMDP 推理,智能体需利用历史信息推断隐藏状态并基于局部信息协调。然而,是否存在热门基准实际要求此类推理,或仅能通过简单策略实现成功,尚不明确。我们引入诊断套件,结合统计检验和信息论探针,对IPPO和MAPPO等基线策略在MPE、SMAX、Overcooked、Hanabi和MaBrax等37个场景下的行为复杂度进行审计。我们的诊断结果表明,这些基准很少要求真正的Dec-POMDP推理。在超过半数场景中,反应式策略的性能可与记忆驱动的智能体相当,涌现协调常依赖脆弱的同步动作耦合,而非稳健的时序影响。这一发现表明,当前训练范式下,某些广泛使用的基准可能不充分测试核心Dec-POMDP假设,可能导致对进展的乐观评估。我们发布诊断工具以支持更严谨的环境设计与评估。

关键词

引用

@article{arxiv.2602.20804,
  title  = {Probing Dec-POMDP Reasoning in Cooperative MARL},
  author = {Kale-ab Tessera and Leonard Hinckeldey and Riccardo Zamboni and David Abel and Amos Storkey},
  journal= {arXiv preprint arXiv:2602.20804},
  year   = {2026}
}

备注

To appear at the 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)