部分动作替换:应对离线 MARL 中的分布迁移
机器学习
2025-11-12 v1 人工智能
多智能体系统
摘要
离线多智能体强化学习 (MARL) 严重受限于评估 out-of-distribution (OOD) 联合动作的挑战。我们的核心发现是,当行为策略被因子化时——即智能体在数据收集期间完全或部分独立行动的常见情形——一种部分动作替换 (PAR) 策略可显著缓解这一挑战。PAR 通过更新单个或部分智能体的动作,而其他智能体保持不变,以行为数据为基准,从而减少相对于完整联合动作更新的分布迁移。基于这一洞察,我们开发了 Soft-Partial Conservative Q-Learning (SPaCQL),使用 PAR 来缓解 OOD 问题,并动态加权基于价值估计不确定性的不同 PAR 策略。我们为该方法提供了严格的理论基础,证明在因子化行为策略下,诱导的分布迁移规模与偏离智能体数量成线性关系,而非联合动作空间的指数级。由此得出该重要离线 MARL 问题的更紧致的价值误差界。我们的理论结果还表明,SPaCQL 能否通过不确定性加权自适应地解决分布迁移问题。我们的实证结果表明 SPaCQL 能够实现更有效的策略学习,并在离线数据 exhibits 独立结构时表现出显著优势。
引用
@article{arxiv.2511.07629,
title = {Partial Action Replacement: Tackling Distribution Shift in Offline MARL},
author = {Yue Jin and Giovanni Montana},
journal= {arXiv preprint arXiv:2511.07629},
year = {2025}
}
备注
Accepted by AAAI 2026