中文

基于离线价值函数记忆与顺序探索的离线到在线多智能体强化学习

人工智能 2026-03-05 v3

摘要

离线到在线强化学习已成为一种强大的范式,利用离线数据进行初始化并通过在线微调来提升样本效率和性能。然而,现有大多数研究都集中在单智能体环境中,仅有限地探索了多智能体扩展,即离线到在线多智能体强化学习(O2O MARL)。在O2O MARL中,随着智能体数量的增加,两个关键挑战变得尤为突出:(i) 由于离线阶段向在线阶段转换期间分布性偏移,导致预训练Q值被遗忘的风险;(ii) 在大型联合状态-动作空间中的高效探索困难。为解决这些挑战,我们提出了一种新颖的O2O MARL框架,称为离线价值函数记忆与顺序探索(OVMSE)。首先,我们引入离线价值函数记忆(OVM)机制,用于计算目标Q值,保留离线训练期间获得的知识,确保平滑的转换,并实现高效的微调。其次,我们提出一种针对O2O MARL的去中心化顺序探索(SE)策略,有效利用预训练的离线策略进行探索,从而显著减少需探索的联合状态-动作空间。在星际多智能体挑战(SMAC)上的大规模实验表明,OVMSE显著优于现有基线方法,实现了卓越的样本效率和整体性能。

关键词

引用

@article{arxiv.2410.19450,
  title  = {Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration},
  author = {Hai Zhong and Xun Wang and Zhuoran Li and Longbo Huang},
  journal= {arXiv preprint arXiv:2410.19450},
  year   = {2026}
}

备注

Include detailed hyperparameter configurations