在未知转移与Bandit反馈下击败对抗性低秩MDPs
机器学习
2024-11-12 v1
摘要
我们考虑在固定转移和对抗性损失下的低秩MDP遗憾最小化。先前的研究分别在全信息损失反馈与未知转移(Zhao et al., 2024)或Bandit损失反馈与已知转移(Foster et al., 2022)下研究此问题。首先,我们将Zhao et al.(2024)在全信息未知转移设定下的遗憾界提升至,其中d为转移的秩,A为动作数,H为视野长度,T为片段数。接下来,我们开启了在Bandit损失反馈与未知转移设定下的研究。假设损失具有线性结构,我们提出了模型基于和模型无关算法,均达到遗憾,尽管它们计算效率较低。我们还提出了计算高效的模型无关算法,达到遗憾。我们表明,对于Bandit情形,线性结构是必要的;在奖励函数上无结构时,遗憾必须随状态数多项式增长。这与全信息情形(Zhao et al., 2024)相反,在全信息情形下,即使奖励函数无结构,遗憾也可以与状态数无关。
引用
@article{arxiv.2411.06739,
title = {Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback},
author = {Haolin Liu and Zakaria Mhammedi and Chen-Yu Wei and Julian Zimmert},
journal= {arXiv preprint arXiv:2411.06739},
year = {2024}
}
备注
NeurIPS 2024