中文

PTDE:面向多智能体强化学习的个性化训练与蒸馏执行

人工智能 2024-04-23 v2 机器学习 多智能体系统

摘要

集中训练与分散执行(CTDE)已成为多智能体强化学习中广泛采用的范式,强调利用全局信息学习增强的联合 QQ 函数或集中式评论家。相比之下,我们的研究致力于利用全局信息直接增强个体 QQ 函数或个体行动者。值得注意的是,我们发现对所有智能体统一施加相同的全局信息不足以获得最优性能。因此,我们主张为每个智能体定制全局信息,构建智能体个性化的全局信息以提升整体性能。此外,我们提出了一种名为个性化训练与蒸馏执行(PTDE)的新范式,其中将智能体个性化的全局信息蒸馏到该智能体的局部信息中。该蒸馏信息随后在分散执行阶段被使用,从而带来极小的性能退化。PTDE 可与最先进算法无缝集成,在包括 SMAC 基准、Google Research Football(GRF)基准以及 Learning to Rank(LTR)任务在内的多种基准上取得显著的性能提升。

关键词

引用

@article{arxiv.2210.08872,
  title  = {PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning},
  author = {Yiqun Chen and Hangyu Mao and Jiaxin Mao and Shiguang Wu and Tianle Zhang and Bin Zhang and Wei Yang and Hongxing Chang},
  journal= {arXiv preprint arXiv:2210.08872},
  year   = {2024}
}

备注

Accepted by IJCAI 2024