中文

MIR:基于相互内在奖励的多智能体强化学习中高效探索

人工智能 2025-11-24 v1 机器学习

摘要

episodic rewards 对于强化学习构成重大挑战。虽然内在奖励方法在单智能体强化学习场景中显示出有效性,但其在多智能体强化学习 (MARL) 中的应用仍存在问题。主要困难源于两个因素:(1) 随着探索空间的扩大,联合动作轨迹的指数稀疏性导致奖励;(2) 现有方法往往未能考虑可以影响团队状态的联合动作。为解决这些挑战,本文引入相互内在奖励 (MIR),这是一种简单而有效的 MARL 增强策略,适用于极度稀疏奖励如 episodic rewards。MIR 鼓励 individual agents 探索影响其团队成员的动作,当与原始策略结合时,有效刺激团队探索并提高算法性能。为进行全面的实验验证,我们将代表性单智能体 MiniGrid 环境扩展为创建 MiniGrid-MA,一个具有稀疏奖励的 MARL 环境系列。我们的评估将提出的方法与 MiniGrid-MA 设置下的先进方法进行比较,实验结果显示其性能优异。

关键词

引用

@article{arxiv.2511.17165,
  title  = {MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward},
  author = {Kesheng Chen and Wenjian Luo and Bang Zhang and Zeping Yin and Zipeng Ye},
  journal= {arXiv preprint arXiv:2511.17165},
  year   = {2025}
}