混合训练以提升多主体强化学习中的多任务泛化
机器学习
2025-11-11 v2 多智能体系统
摘要
在多主体强化学习(MARL)中,实现对多样化智能体和目标的多任务泛化具有诸多挑战。现有在线MARL算法主要关注单任务性能,但其缺乏多任务泛化能力通常导致计算资源浪费和实际应用受限。另一方面,现有离线多任务MARL方法高度依赖数据质量,往往在未见任务上表现不佳。本文引入HyGen,即一种新型混合MARL框架,Hybrid Training for Enhanced Multi-Task Generalization,通过整合在线和离线学习,确保多任务泛化与训练效率。具体而言,该框架从离线多任务数据集中提取潜在的通用技能,然后在集中训练、分布执行(CTDE)范式下训练策略以选择最优技能。在此阶段,我们利用集成离线数据与在线交互的回放缓冲区。我们通过实验表明,该框架有效提取并细化通用技能,显著提升对未见任务的泛化能力。在星际争霸多主体挑战上的比较分析显示,HyGen在性能上优于广泛的现有纯在线和离线方法。
引用
@article{arxiv.2408.13567,
title = {Hybrid Training for Enhanced Multi-task Generalization in Multi-agent Reinforcement Learning},
author = {Mingliang Zhang and Sichang Su and Chengyang He and Guillaume Sartoretti},
journal= {arXiv preprint arXiv:2408.13567},
year = {2025}
}
备注
NeurIPS 2025 ARLET Workshop