中文

多智能体强化学习中隐藏礼物的挑战

机器学习 2026-04-10 v6 人工智能 多智能体系统

摘要

有时,我们会在不知情的情况下受益于他人的行为。例如,如果你的邻居在你不在家时选择不占用你房前的停车位,你就能受益,即使你并未意识到他们采取了这一行动。这些“隐藏礼物”对多智能体强化学习(MARL)构成了一个有趣的挑战,因为当其他智能体的有益行为被隐藏时,信用分配并非易事。在此,我们通过一个简单的 MARL 任务研究隐藏礼物的影响。在该任务中,网格世界环境中的智能体各自有需要打开的门,以获得个体奖励。同时,如果所有智能体都打开了自己的门,整个群体将获得更大的集体奖励。然而,所有门只有一把钥匙,因此只有当智能体使用钥匙后将其留给其他智能体时,才能获得集体奖励。值得注意的是,没有任何信息能向一个智能体表明其他智能体已经放下了钥匙,因此这种为他人的行为就是“隐藏礼物”。我们展示了多种不同的最先进 MARL 算法,包括 MARL 专用架构,都无法在这个简单任务中学会如何获得集体奖励。有趣的是,我们发现当为去中心化的演员-评论家策略梯度智能体提供其自身动作历史信息时,它们能够成功,但 MARL 智能体即使有动作历史也无法解决该任务。最后,受学习感知方法的启发,我们为策略梯度智能体推导出一个修正项,该修正项降低了学习中的方差,并帮助它们更可靠地收敛到集体成功。这些结果表明,在存在“隐藏礼物”的情况下,多智能体环境中的信用分配可能特别具有挑战性,并证明去中心化智能体的自我学习感知能力可以使这些环境受益。

关键词

引用

@article{arxiv.2505.20579,
  title  = {The challenge of hidden gifts in multi-agent reinforcement learning},
  author = {Dane Malenfant and Blake A. Richards},
  journal= {arXiv preprint arXiv:2505.20579},
  year   = {2026}
}

备注

Increased analysis of LOLA baselines and moved to main section. Cleaned up proof and fixed error where gradient symbol was left in front of the log(policy). Self correction becomes more intuitive