中文

对抗性线性混合MDP的近最优动态遗憾

机器学习 2024-11-06 v1 机器学习

摘要

我们研究在完全信息反馈下,具有未知转移和对抗性奖励的回合制线性混合MDP,以动态遗憾作为性能度量。我们首先深入分析两种最流行方法的优势与局限:基于占用度的方法和基于策略的方法。我们观察到,基于占用度的方法在应对非平稳环境方面有效,但在处理未知转移时遇到困难。相比之下,基于策略的方法可以有效处理未知转移,但在应对非平稳环境时面临挑战。在此基础上,我们提出了一种结合两种方法优势的新算法。具体而言,它采用(i)具有双层结构的基于占用度的全局优化来处理非平稳环境;以及(ii)基于策略的方差感知值目标回归来处理未知转移。我们通过一种新颖的转换将这两部分联系起来。我们的算法具有 O~(dH3K+HK(H+PˉK))\widetilde{\mathcal{O}}(d \sqrt{H^3 K} + \sqrt{HK(H + \bar{P}_K)}) 的动态遗憾,其中 dd 为特征维度,HH 为回合长度,KK 为回合数,PˉK\bar{P}_K 为非平稳性度量。我们通过建立匹配的下界证明其在对数因子范围内是最小最大最优的。据我们所知,这是首个在无需先验知晓非平稳性度量的条件下,对具有未知转移的对抗性线性混合MDP实现近最优动态遗憾的工作。

关键词

引用

@article{arxiv.2411.03107,
  title  = {Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs},
  author = {Long-Fei Li and Peng Zhao and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2411.03107},
  year   = {2024}
}

备注

NeurIPS 2024