中文

针对具有Bandit反馈与未知转移的对抗线性混合MDP的改进算法

机器学习 2024-03-08 v1 机器学习

摘要

我们研究在bandit反馈设置下,具有线性函数近似、未知转移和对抗损失的强化学习。具体而言,我们关注转移核为线性混合模型的线性混合MDP。我们提出了一种新算法,以高概率获得 O~(dHS3K+HSAK)\widetilde{O}(d\sqrt{HS^3K} + \sqrt{HSAK}) 的遗憾,其中 dd 是特征映射的维度,SS 是状态空间大小,AA 是动作空间大小,HH 是回合长度,KK 是回合数。由于分层MDP结构满足 HSH \leq S,我们的结果严格改进了 Zhao 等人 (2023a) 之前已知的最佳结果 O~(dS2K+HSAK)\widetilde{O}(dS^2 \sqrt{K} + \sqrt{HSAK})。我们的进展主要归因于:(i) 一种用于转移参数的新最小二乘估计器,它利用了所有状态的访问信息,而先前工作仅利用单一状态;以及 (ii) 一种专门为处理非独立噪声而定制的新自归一化集中不等式,该不等式最初提出于动态选品领域,并首次应用于强化学习以处理不同状态之间的相关性。

关键词

引用

@article{arxiv.2403.04568,
  title  = {Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition},
  author = {Long-Fei Li and Peng Zhao and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2403.04568},
  year   = {2024}
}

备注

AISTATS 2024