基于价值导向的MeanFlow用于离线多智能体强化学习
机器学习
2026-04-10 v1
摘要
离线多智能体强化学习(MARL)旨在从预收集的数据集中学习最优联合策略,需要在最大化全局回报与缓解离线数据分布偏移之间进行权衡。最近的研究使用扩散或流生成模型捕捉多智能体间复杂的联合行为,但通常依赖于多步迭代采样,从而降低训练和推理效率。尽管进一步的研究通过蒸馏等方法提高了采样效率,但仍对行为正则化系数敏感。为解决上述问题,本文提出了价值引导多智能体MeanFlow策略(VGMP),这是一种简单而有效的基于流的策略学习框架,实现了带有系数不敏感条件行为克隆的高效动作生成。具体而言,VGMP利用全局优势值引导智能体协作,将最优策略学习视为条件行为克隆。此外,为提高多智能体场景下的策略表达性和推理效率,本文利用classifier-free引导MeanFlow进行策略训练和执行。在包含离散和连续动作空间的任务上实验表明,尽管仅通过条件行为克隆训练,VGMP仍能高效实现与最先进方法相当的性能。
引用
@article{arxiv.2604.08174,
title = {Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning},
author = {Teng Pang and Zhiqiang Dong and Yan Zhang and Rongjian Xu and Guoqiang Wu and Yilong Yin},
journal= {arXiv preprint arXiv:2604.08174},
year = {2026}
}