无标度对抗性强化学习
机器学习
2024-03-05 v1 人工智能
摘要
本文启动了马尔可夫决策过程(MDPs)中无标度学习的研究,其中奖励/损失的尺度对学习者未知。我们设计了一个通用算法框架,即\underline{S}cale \underline{C}lipping \underline{B}ound (\texttt{SCB}),并在对抗性多臂老虎机(MAB)设置和对抗性 MDP 设置中实例化了该框架。通过该框架,我们在无标度对抗性 MAB 中实现了首个极小极大最优期望遗憾界和首个高概率遗憾界,解决了 \cite{hadiji2023adaptation} 中提出的开放问题。在对抗性 MDP 上,我们的框架也诞生了首个具有 高概率遗憾保证的无标度 RL 算法。
引用
@article{arxiv.2403.00930,
title = {Scale-free Adversarial Reinforcement Learning},
author = {Mingyu Chen and Xuezhou Zhang},
journal= {arXiv preprint arXiv:2403.00930},
year = {2024}
}