中文

通过探索实现多智能体强化学习中更好的样本效率

机器学习 2025-03-18 v1 多智能体系统

摘要

多智能体强化学习在学习团队环境中的协作行为方面展现出前景。然而,此类方法通常需要大量训练时间。例如,最先进的方法 TiZero 训练足球环境中的高质量策略需要 40 天。本文假设更好的探索机制可以提升多智能体方法的样本效率。我们为 TiZero 提出了两种不同的探索方法:自监督内在奖励和随机网络蒸馏奖励。此外,我们对原始算法引入了架构修改以提升 TiZero 的计算效率。我们通过大量实验评估了这些方法的样本效率。结果表明,随机网络蒸馏相比原始 TiZero 将训练样本效率提升了 18.8%。此外,我们针对两种变体产生的模型与启发式 AI 进行了定性行为评估:自监督奖励鼓励控球,而随机网络蒸馏带来了更具进攻性的表现。我们的结果凸显了随机网络蒸馏变体在实际场景中的适用性。最后,由于所提方法的本质,我们承认其在足球模拟之外的应用,特别是在具有强多智能体和策略性特征的环境中。

关键词

引用

@article{arxiv.2503.13077,
  title  = {Towards Better Sample Efficiency in Multi-Agent Reinforcement Learning via Exploration},
  author = {Amir Baghi and Jens Sjölund and Joakim Bergdahl and Linus Gisslén and Alessandro Sestini},
  journal= {arXiv preprint arXiv:2503.13077},
  year   = {2025}
}

备注

8 pages, 3 figures