中文

强化学习泛化的博弈论视角

机器学习 2022-10-07 v2 计算机科学与博弈论

摘要

强化学习(RL)中的泛化对于RL算法的实际部署十分重要。人们提出了多种方案来解决泛化问题,包括迁移学习、多任务学习和元学习,以及鲁棒与对抗强化学习。然而,这些不同方案缺乏统一表述,也缺少跨方案方法的综合比较。本工作中,我们提出一个用于强化学习泛化的博弈论框架,称为GiRL,其中RL智能体在一组任务上对抗一个对手,该对手可在给定阈值内操纵任务分布。通过不同配置,GiRL可涵盖上述各类方案。为求解GiRL,我们改编了博弈论中广泛使用的策略空间响应预言(PSRO)方法,并做了以下三点重要修改:i)我们使用模型无关元学习(MAML)作为最优响应预言;ii)我们提出一种改进投影复制动力学,即R-PRD,以确保计算出的对手元策略落在阈值内;iii)我们还提出了一种测试阶段多策略少样本学习的协议。在MuJoCo环境上的大量实验表明,我们提出的方法优于现有基线,例如MAML。

关键词

引用

@article{arxiv.2208.03650,
  title  = {A Game-Theoretic Perspective of Generalization in Reinforcement Learning},
  author = {Chang Yang and Ruiyu Wang and Xinrun Wang and Zhen Wang},
  journal= {arXiv preprint arXiv:2208.03650},
  year   = {2022}
}