中文

可扩展的多智能体离线强化学习与信息的作用

机器学习 2025-06-06 v2

摘要

离线强化学习(RL)专注于仅从先前收集的一批数据中学习策略,提供了在不需昂贵或风险高的主动探索的情况下有效利用此类数据集的潜力。虽然离线多智能体强化学习(MARL)的最新进展显示出前景,但大多数现有方法要么依赖所有智能体联合收集的大数据集,要么依赖独立收集的智能体特定数据集。前者确保了强大的性能但引发了可扩展性担忧,而后者强调可扩展性却以牺牲性能保证为代价。在这项工作中,我们提出了一种用于数据集收集和离线学习的新颖可扩展例程。智能体首先通过预指定的信息共享网络连贯地收集多样化数据集,随后学习连贯的局部策略,而无需完全可观测性或退回到完全去中心化。我们从理论上证明,这种结构化方法允许 seminal Fitted Q-Iteration(FQI)算法的多智能体扩展以高概率全局收敛到接近最优的策略。收敛受依赖于共享信息信息量的误差项支配。此外,我们展示了这种方法如何允许用共享信息与未共享信息之间的互信息来界定FQI监督学习阶段的固有误差。我们的算法——可扩展多智能体FQI(SCAM-FQI)——随后在一个分布式决策问题上进行了评估。实证结果与我们的理论发现一致,支持了SCAM-FQI在实现可扩展性与策略性能之间平衡的有效性。

关键词

引用

@article{arxiv.2502.11260,
  title  = {Scalable Multi-Agent Offline Reinforcement Learning and the Role of Information},
  author = {Riccardo Zamboni and Enrico Brunetti and Marcello Restelli},
  journal= {arXiv preprint arXiv:2502.11260},
  year   = {2025}
}