随机与对抗 MDP 中的协作式在线学习
机器学习
2022-09-02 v3
摘要
我们研究随机与对抗马尔可夫决策过程(MDP)中的协作式在线学习。即在每一回合中, 个智能体同时与 MDP 交互并共享信息,以最小化各自的遗憾。我们考虑具有两类随机性的环境:\emph{新鲜}——每个智能体的轨迹被独立同分布采样;以及 \emph{非新鲜}——实现由所有智能体共享(但每个智能体的轨迹也受其自身动作影响)。更确切地说,在非新鲜随机性下,每个回合开始时固定每个代价与转移的实化,且在相同时间、相同状态采取相同动作的智能体观测到相同的代价与下一状态。我们透彻分析了所有相关设定,凸显了模型间的挑战与差异,并证明了近乎匹配的遗憾下界与上界。据我们所知,我们是首个考虑具有非新鲜随机性或对抗 MDP 中协作式强化学习(RL)的工作。
引用
@article{arxiv.2201.13170,
title = {Cooperative Online Learning in Stochastic and Adversarial MDPs},
author = {Tal Lancewicki and Aviv Rosenberg and Yishay Mansour},
journal= {arXiv preprint arXiv:2201.13170},
year = {2022}
}