解谜:离线多智能体强化学习的局部到全局世界模型
人工智能
2026-03-01 v2 计算机科学与博弈论
机器学习
摘要
离线多智能体强化学习(MARL)旨在使用预收集的数据集解决多智能体系统中的合作决策问题。现有的离线MARL方法主要限制于数据分布内的训练,导致过于保守的策略难以在数据支持范围之外获得泛化。虽然基于模型的方法提供了可行的解决方案,通过从学习的世界模型生成的合成数据扩展原始数据集来实现,但由于多智能体系统的高维度、非平稳性和复杂性,直接估计转换和奖励函数在离线MARL中具有挑战。鉴于直接建模联合动力学的困难,我们提出了一种局部到全局(LOGO)世界模型,这是一种新型框架,利用局部预测——因为估计较容易——来推断全局状态动力学,从而提高预测精度,同时隐式地捕获智能体之间的依赖关系。使用训练好的世界模型,我们生成合成数据来扩充原始数据集,扩展有效的状态-动作空间。为确保可靠的策略学习,我们进一步引入一种不确定性感知的采样机制,通过预测不确定性自适应地对合成数据进行加权,从而减少近似误差传播到策略。与常规的基于小样本的方法相比,我们的方法仅需要一个额外的编码器进行不确定性估计,显著减少了计算开销,同时保持准确性。在8个场景中对8个基线进行广泛实验,证明该方法在标准离线MARL基准测试中超越了最先进的基线,建立了一个通用的可泛化离线多智能体学习的新型模型基线。
关键词
引用
@article{arxiv.2601.07463,
title = {Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning},
author = {Sijia Li and Xinran Li and Shibo Chen and Jun Zhang},
journal= {arXiv preprint arXiv:2601.07463},
year = {2026}
}