对抗性线性混合 MDP 中的无 horizon 强化学习
机器学习
2023-05-16 v1 最优化与控制
机器学习
摘要
近期研究表明,当总奖励以 为界时,情节式强化学习(RL)并不比 bandit 问题更难,并证明了其 regret 界对规划 horizon 具有多对数依赖。然而,这类结果能否推广到对抗性 RL(即每轮奖励由对抗者选择)仍是一个开放问题。本文以肯定方式回答了该问题,提出了首个无 horizon 策略搜索算法。为应对由探索与对抗性奖励选择带来的挑战,我们的算法采用(1)针对转移核的方差-不确定性感知加权最小二乘估计器;以及(2)基于占据测度的随机策略在线搜索技术。我们证明了在完全信息反馈下,算法达到 的 regret,其中 为已知特征映射的维度,该映射线性参数化 MDP 未知转移核, 为情节数, 与 为状态与动作空间基数。我们还给出了困难性结果与 regret 下界,以论证算法的近最优性以及 与 在 regret 界中不可避免。
引用
@article{arxiv.2305.08359,
title = {Horizon-free Reinforcement Learning in Adversarial Linear Mixture MDPs},
author = {Kaixuan Ji and Qingyue Zhao and Jiafan He and Weitong Zhang and Quanquan Gu},
journal= {arXiv preprint arXiv:2305.08359},
year = {2023}
}
备注
34 pages