中文

竞争式强化学习的后验采样:函数逼近与部分可观测性

机器学习 2023-11-01 v1 计算机科学与博弈论 机器学习

摘要

本文研究了在一般函数逼近背景下竞争式强化学习(RL)的后验采样算法。聚焦于零和马尔可夫博弈(MGs)在自博弈与对抗学习两种关键设定下,我们首先提出自博弈与对抗广义 eluder 系数(GEC)作为函数逼近的复杂度度量,刻画了 MGs 中的探索-利用权衡。基于自博弈 GEC,我们提出一种基于模型的自博弈后验采样方法,以控制双方玩家学习纳什均衡,该方法能成功处理状态的部分可观测性。此外,我们确定了一类部分可观测 MG 模型,适配带有对手对抗策略的 MG 学习。结合对抗 GEC,我们提出一种基于模型的对抗 MG 后验采样方法,可处理潜在的部分可观测性。我们进一步为所提算法提供了较低的悔界,其可随所提 GEC 与回合次数 TT 呈次线性增长。据我们所知,我们首次开发了通用的基于模型的后验采样算法用于竞争式 RL,可应用于绝大多数可处理的零和 MG 类别,涵盖完全可观测与部分可观测 MG 中的自博弈与对抗学习。

关键词

引用

@article{arxiv.2310.19861,
  title  = {Posterior Sampling for Competitive RL: Function Approximation and Partial Observation},
  author = {Shuang Qiu and Ziyu Dai and Han Zhong and Zhaoran Wang and Zhuoran Yang and Tong Zhang},
  journal= {arXiv preprint arXiv:2310.19861},
  year   = {2023}
}

备注

NeurIPS 2023