中文

RGMComm:多智能体强化学习中通过离散通信最小化回报差距

人工智能 2023-12-20 v5

摘要

在部分可观测马尔可夫决策过程中,通信对于求解协作式多智能体强化学习任务至关重要。现有工作常依赖黑盒方法将局部信息/特征编码为与其他智能体共享的消息,导致生成具有高通信开销和较差可解释性的连续消息。先前离散通信方法的尝试生成作为智能体动作一部分训练的单热向量,并使用 Gumbel softmax 操作计算消息梯度,这些均为启发式设计,未对期望回报提供任何量化保证。本文建立了具有完全可观测性的理想策略与具有离散通信的最优部分可观测策略之间回报差距的上界。该结果使我们能够将多智能体通信重新表述为各智能体局部观测上的一种新颖在线聚类问题,以消息作为簇标签,以回报差距上界作为聚类损失。为最小化回报差距,我们提出回报差距最小化通信(RGMComm)算法,其是一种令人惊讶简单的离散消息生成函数设计,并通过利用一种新颖的正则化信息最大化损失函数(将余弦距离作为聚类度量)与强化学习相集成。评估表明,RGMComm 显著优于最先进的多智能体通信基线,并能以天然可解释的少比特消息实现近乎最优的回报。

关键词

引用

@article{arxiv.2308.03358,
  title  = {RGMComm: Return Gap Minimization via Discrete Communications in Multi-Agent Reinforcement Learning},
  author = {Jingdi Chen and Tian Lan and Carlee Joe-Wong},
  journal= {arXiv preprint arXiv:2308.03358},
  year   = {2023}
}