中文

对抗性线性混合 MDP 中的无 horizon 强化学习

机器学习 2023-05-16 v1 最优化与控制 机器学习

摘要

近期研究表明,当总奖励以 11 为界时,情节式强化学习(RL)并不比 bandit 问题更难,并证明了其 regret 界对规划 horizon HH 具有多对数依赖。然而,这类结果能否推广到对抗性 RL(即每轮奖励由对抗者选择)仍是一个开放问题。本文以肯定方式回答了该问题,提出了首个无 horizon 策略搜索算法。为应对由探索与对抗性奖励选择带来的挑战,我们的算法采用(1)针对转移核的方差-不确定性感知加权最小二乘估计器;以及(2)基于占据测度的随机策略在线搜索技术。我们证明了在完全信息反馈下,算法达到 O~((d+log(S2A))K)\tilde{O}\big((d+\log (|\mathcal{S}|^2 |\mathcal{A}|))\sqrt{K}\big) 的 regret,其中 dd 为已知特征映射的维度,该映射线性参数化 MDP 未知转移核,KK 为情节数,S|\mathcal{S}|A|\mathcal{A}| 为状态与动作空间基数。我们还给出了困难性结果与 regret 下界,以论证算法的近最优性以及 logS\log|\mathcal{S}|logA\log|\mathcal{A}| 在 regret 界中不可避免。

关键词

引用

@article{arxiv.2305.08359,
  title  = {Horizon-free Reinforcement Learning in Adversarial Linear Mixture MDPs},
  author = {Kaixuan Ji and Qingyue Zhao and Jiafan He and Weitong Zhang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2305.08359},
  year   = {2023}
}

备注

34 pages