针对具有Bandit反馈与未知转移的对抗线性混合MDP的改进算法
机器学习
2024-03-08 v1 机器学习
摘要
我们研究在bandit反馈设置下,具有线性函数近似、未知转移和对抗损失的强化学习。具体而言,我们关注转移核为线性混合模型的线性混合MDP。我们提出了一种新算法,以高概率获得 的遗憾,其中 是特征映射的维度, 是状态空间大小, 是动作空间大小, 是回合长度, 是回合数。由于分层MDP结构满足 ,我们的结果严格改进了 Zhao 等人 (2023a) 之前已知的最佳结果 。我们的进展主要归因于:(i) 一种用于转移参数的新最小二乘估计器,它利用了所有状态的访问信息,而先前工作仅利用单一状态;以及 (ii) 一种专门为处理非独立噪声而定制的新自归一化集中不等式,该不等式最初提出于动态选品领域,并首次应用于强化学习以处理不同状态之间的相关性。
引用
@article{arxiv.2403.04568,
title = {Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition},
author = {Long-Fei Li and Peng Zhao and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:2403.04568},
year = {2024}
}
备注
AISTATS 2024