中文

基于群体的自博弈中多样风险偏好的学习

机器学习 2023-12-18 v2 人工智能 多智能体系统

摘要

在强化学习(RL)的重大成功中,自博弈算法在解决竞争性游戏中起着关键作用。当前的自博弈算法优化智能体以最大化对其当前或历史副本的期望胜率,这常使其陷入局部最优且策略风格单一同质。一种可能的解决方案是提升策略的多样性,这有助于智能体打破僵局并增强面对不同对手时的鲁棒性。然而,在自博弈算法中增强多样性并非易事。本文中,我们旨在从智能体面对不确定性时可能具有多样风险偏好的视角引入多样性。具体而言,我们设计了一种称为风险敏感近端策略优化(RPPO)的新型强化学习算法,它在最坏情况与最好情况策略学习之间平滑插值,并允许以期望的风险偏好进行策略学习。将RPPO与基于群体的自博弈无缝结合,群体中的智能体利用与多样对手对弈的经验优化动态风险敏感目标。实证结果表明,我们的方法在竞争性游戏中取得了可比或更优的性能,并涌现出多样的行为模式。我们的代码公开于 \url{https://github.com/Jackory/RPBT}。

关键词

引用

@article{arxiv.2305.11476,
  title  = {Learning Diverse Risk Preferences in Population-based Self-play},
  author = {Yuhua Jiang and Qihan Liu and Xiaoteng Ma and Chenghao Li and Yiqin Yang and Jun Yang and Bin Liang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2305.11476},
  year   = {2023}
}

备注

AAAI2024