中文

面向离线多智能体强化学习的稳定配方

机器学习 2026-03-10 v1 人工智能 机器人学

摘要

尽管单智能体离线强化学习(RL)取得了显著成就,但多智能体 RL(MARL)仍大多依赖在-policy 训练和从零自我对弈。一个原因在于非线性价值分解导致不稳定,导致 prior works 避免复杂混合网络,倾向于采用线性价值分解(如 VDN)并使用单智能体 setup 中的价值正则化。在本文中,我们分析了离线 MARL 设置下非线性价值分解的不稳定来源。我们的观察确认,这些方法诱导价值尺度放大和不稳定优化。为缓解此问题,我们提出一种简单技术,即尺度不变价值归一化(SVN),在不改变 Bellman 固定点的前提下稳定了 actor-critic 训练。实验上,我们检验了离线 MARL 关键组件(如价值分解、价值学习和策略提取)之间的相互作用,得出实用配方以充分发挥其潜力。

关键词

引用

@article{arxiv.2603.08399,
  title  = {A Recipe for Stable Offline Multi-agent Reinforcement Learning},
  author = {Dongsu Lee and Daehee Lee and Amy Zhang},
  journal= {arXiv preprint arXiv:2603.08399},
  year   = {2026}
}

备注

Preprint