中文

基于种群的强化学习中的阶段性多样性优化

机器学习 2024-03-19 v1 人工智能

摘要

回顾以往的多样性强化学习工作,多样性通常通过增强损失函数获得,这需要在奖励和多样性之间取得平衡。通常,多样性优化算法使用多臂老虎机算法在预定义的空间中选择系数。然而,多臂老虎机奖励信号的动态分布或质量与多样性之间的冲突限制了这些方法的性能。我们引入了阶段性多样性优化算法,这是一种基于种群的训练框架,它将奖励和多样性训练分离到不同的阶段,而不是优化多目标函数。在辅助阶段,通过行列式实现多样化的表现不佳的智能体不会替换存档中表现更好的智能体。奖励和多样性的解耦使我们能够在辅助阶段使用激进的多样性优化而不会导致性能下降。此外,我们为空中智能体构建了一个空战场景,以展示 PDO 算法的实用性。我们引入了两种 PDO 存档的实现,并在新提出的对抗性空战和 MuJoCo 模拟中进行了测试。结果表明,我们提出的算法取得了优于基线的性能。

关键词

引用

@article{arxiv.2403.11114,
  title  = {Phasic Diversity Optimization for Population-Based Reinforcement Learning},
  author = {Jingcheng Jiang and Haiyin Piao and Yu Fu and Yihang Hao and Chuanlu Jiang and Ziqi Wei and Xin Yang},
  journal= {arXiv preprint arXiv:2403.11114},
  year   = {2024}
}

备注

7 pages, 4 figures