中文

在未知转移与Bandit反馈下击败对抗性低秩MDPs

机器学习 2024-11-12 v1

摘要

我们考虑在固定转移和对抗性损失下的低秩MDP遗憾最小化。先前的研究分别在全信息损失反馈与未知转移(Zhao et al., 2024)或Bandit损失反馈与已知转移(Foster et al., 2022)下研究此问题。首先,我们将Zhao et al.(2024)在全信息未知转移设定下的poly(d,A,H)T5/6poly(d, A, H)T^{5/6}遗憾界提升至poly(d,A,H)T2/3poly(d, A, H)T^{2/3},其中d为转移的秩,A为动作数,H为视野长度,T为片段数。接下来,我们开启了在Bandit损失反馈与未知转移设定下的研究。假设损失具有线性结构,我们提出了模型基于和模型无关算法,均达到poly(d,A,H)T2/3poly(d, A, H)T^{2/3}遗憾,尽管它们计算效率较低。我们还提出了计算高效的模型无关算法,达到poly(d,A,H)T4/5poly(d, A, H)T^{4/5}遗憾。我们表明,对于Bandit情形,线性结构是必要的;在奖励函数上无结构时,遗憾必须随状态数多项式增长。这与全信息情形(Zhao et al., 2024)相反,在全信息情形下,即使奖励函数无结构,遗憾也可以与状态数无关。

关键词

引用

@article{arxiv.2411.06739,
  title  = {Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback},
  author = {Haolin Liu and Zakaria Mhammedi and Chen-Yu Wei and Julian Zimmert},
  journal= {arXiv preprint arXiv:2411.06739},
  year   = {2024}
}

备注

NeurIPS 2024