中文

OM2P:离线多智能体平均流策略

机器学习 2026-03-02 v2 人工智能

摘要

生成模型,特别是扩散和基于流的模型,在离线多智能体强化学习中展现出前景。然而,将强大的生成模型集成到此框架中带来了独特的挑战。特别是,扩散和基于流的策略由于其迭代生成过程而采样效率低下,这使得它们在时间敏感或资源受限的环境中不切实际。为了解决这些困难,我们提出了 OM2P(离线多智能体平均流策略),这是一种新颖的离线 MARL 算法,旨在实现高效的单步动作采样。为了解决生成目标与奖励最大化之间的不一致,我们引入了一种奖励感知优化方案,该方案将精心设计的平均流匹配损失与 Q 函数监督相结合。此外,我们设计了一种广义的时间步分布和一种无导数估计策略,以减少内存开销并提高训练稳定性。在多智能体粒子环境和 MuJoCo 基准上的实证评估表明,OM2P 实现了卓越的性能,GPU 内存使用量减少了高达 3.8 倍,训练时间加快了高达 10.8 倍。我们的方法是首次成功将平均流模型集成到离线 MARL 中,为在协作多智能体环境中实现实用且可扩展的生成策略铺平了道路。

关键词

引用

@article{arxiv.2508.06269,
  title  = {OM2P: Offline Multi-Agent Mean-Flow Policy},
  author = {Zhuoran Li and Xun Wang and Hai Zhong and Qingxin Xia and Lihua Zhang and Longbo Huang},
  journal= {arXiv preprint arXiv:2508.06269},
  year   = {2026}
}