中文

在合作 MARL 中重记忆马尔可夫性质

机器学习 2025-07-25 v1 多智能体系统

摘要

合作多智能体强化学习(MARL)通常被形式化为 decentralized partially observable Markov decision process(Dec-POMDP),其中智能体必须推理环境及其他智能体的行为。实际情况下,当前的 model-free MARL 算法使用简单的循环函数逼近器来应对利用部分信息推理他人的挑战。本position paper我们认为,这些方法的经验性成功并非源于有效的马尔可夫信号恢复,而是源于学习简单的约定,这些约定绕过环境观测和记忆。通过一个针对性案例研究,我们展示,协同适应的智能体可以学习脆弱的约定,当与非自适应智能体合作时,这些约定会失败。关键的是,相同的模型在任务设计需要时能够学习具象化的策略,这表明问题并非学习模型的根本局限,而是基准设计的失效。我们的分析还表明,现代 MARL 环境可能不充分测试 Dec-POMDP 的核心假设。因此,我们倡导建立新的合作环境,基于两个核心原则:(1) 基于观测的行为,(2) 关于其他智能体的记忆推理,确保成功需要的是真正的技能,而非脆弱的、协同适应的约定。

关键词

引用

@article{arxiv.2507.18333,
  title  = {Remembering the Markov Property in Cooperative MARL},
  author = {Kale-ab Abebe Tessera and Leonard Hinckeldey and Riccardo Zamboni and David Abel and Amos Storkey},
  journal= {arXiv preprint arXiv:2507.18333},
  year   = {2025}
}

备注

RLC Finding the Frame Workshop Camera-Ready, 8 pages