中文

基于扩散的离线多智能体强化学习情节增强

机器学习 2024-08-26 v1

摘要

离线多智能体强化学习因其能在实时交互不切实际、有风险或成本高昂的环境中有效部署强化学习算法而日益受到重视。在离线设置中,从过去交互的静态数据集中学习,可以在无需实时数据收集(这可能充满挑战)的情况下开发稳健且安全的策略。基于这一基础重要性,我们提出了EAQ(基于Q总损失引导的情节增强),一种利用扩散模型的离线多智能体强化学习框架的新方法。EAQ将Q总函数直接集成到扩散模型中作为引导,以最大化情节中的全局回报,无需单独训练。我们主要关注合作场景,其中智能体需要共同行动以实现共享目标——本质上是最大化全局回报。因此,我们证明,与原始数据集相比,我们的协作式情节增强显著提升了离线多智能体强化学习算法的性能,在SMAC模拟器中,对于中等和较差行为策略,归一化回报分别提高了17.3%和12.9%。

关键词

引用

@article{arxiv.2408.13092,
  title  = {Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning},
  author = {Jihwan Oh and Sungnyun Kim and Gahee Kim and Sunghwan Kim and Se-Young Yun},
  journal= {arXiv preprint arXiv:2408.13092},
  year   = {2024}
}

备注

Accepted by SPIGM Workshop at ICML 2024 (Structured Probabilistic Inference & Generative Modeling)