中文

无标度对抗性强化学习

机器学习 2024-03-05 v1 人工智能

摘要

本文启动了马尔可夫决策过程(MDPs)中无标度学习的研究,其中奖励/损失的尺度对学习者未知。我们设计了一个通用算法框架,即\underline{S}cale \underline{C}lipping \underline{B}ound (\texttt{SCB}),并在对抗性多臂老虎机(MAB)设置和对抗性 MDP 设置中实例化了该框架。通过该框架,我们在无标度对抗性 MAB 中实现了首个极小极大最优期望遗憾界和首个高概率遗憾界,解决了 \cite{hadiji2023adaptation} 中提出的开放问题。在对抗性 MDP 上,我们的框架也诞生了首个具有 O~(T)\tilde{\mathcal{O}}(\sqrt{T}) 高概率遗憾保证的无标度 RL 算法。

关键词

引用

@article{arxiv.2403.00930,
  title  = {Scale-free Adversarial Reinforcement Learning},
  author = {Mingyu Chen and Xuezhou Zhang},
  journal= {arXiv preprint arXiv:2403.00930},
  year   = {2024}
}