中文

无线通信增强的值分解:多智能体强化学习

机器学习 2026-04-13 v1

摘要

多智能体强化学习(MARL)中的合作受益于智能体间通信,但大多数方法假设理想化信道,现有值分解方法忽略了谁成功共享了信息与谁之间的关系。我们提出CLOVER,一个其集中值混合器受现实无线信道下实现的通信图所条件化的合作MARL框架。该图在值分解中引入关系归纳偏置,限制了基于实现的通信结构如何混合个体效用。混合器是一个GNN,其节点特定权重由Permutation-Equivariant Hypernetwork生成:沿通信边的多跳传播重新塑造信用分配,使得不同拓扑结构导致不同的混合。我们证明该混合器是置换不变的、单调的(保持IGM条件),且严格比QMIX式混合器更具表达力。在处理现实信道时,我们构建一个将随机信道效应从智能体计算图中隔离的增强MDP,并采用随机感受野编码器处理可变大小的消息集合,实现端到端可微训练。在Predator-Prey和Lumberjacks基准测试中使用p-CSMA无线信道,CLOVER在收敛速度和最终性能上持续优于VDN、QMIX、TarMAC+VDN和TarMAC+QMIX。行为分析确认智能体学习了自适应的信号发送与接收策略,消融实验将通信图归纳偏置确认为改进的关键来源。

关键词

引用

@article{arxiv.2604.08728,
  title  = {Wireless Communication Enhanced Value Decomposition for Multi-Agent Reinforcement Learning},
  author = {Diyi Hu and Bhaskar Krishnamachari},
  journal= {arXiv preprint arXiv:2604.08728},
  year   = {2026}
}