学习离线多智能体强化学习中的部分动作替换
机器学习
2026-03-31 v1 人工智能
多智能体系统
摘要
离线多智能体强化学习(MARL)面临一个关键挑战:联合动作空间随智能体数量呈指数增长,导致数据集覆盖呈指数稀疏,且分布外(OOD)联合动作不可避免。部分动作替换(PAR)通过将一部分智能体锚定到数据集动作来缓解这一问题,但现有方法依赖于以高计算成本枚举多个子集配置,且无法适应不同的状态。我们提出了PLCQL框架,将PAR子集选择表述为上下文bandit问题,并使用带有不确定性加权奖励的近端策略优化学习一个状态依赖的PAR策略。该自适应策略动态确定每次更新步骤中替换多少智能体,在策略改进与保守价值估计之间取得平衡。我们证明了一个价值误差界,表明估计误差随偏离智能体的期望数量线性增长。与之前的PAR方法SPaCQL相比,PLCQL将每次迭代的Q函数评估次数从n减少到1,显著提高了计算效率。在经验上,PLCQL在MPE、MaMuJoCo和SMAC基准测试中66%的任务上取得了最高的归一化分数,在84%的任务上超越了SPaCQL,同时大幅降低了计算成本。
引用
@article{arxiv.2603.28573,
title = {Learning Partial Action Replacement in Offline MARL},
author = {Yue Jin and Giovanni Montana},
journal= {arXiv preprint arXiv:2603.28573},
year = {2026}
}