中文

重尾奖励下基于线性函数近似的方差感知鲁棒强化学习

机器学习 2023-03-15 v2 人工智能 统计理论 机器学习 统计理论

摘要

本文针对仅具有有限方差的重尾奖励,提出了两种用于在线序贯决策的算法 AdaOFUL 与 VARA。对于线性随机 bandit,我们通过改进自适应 Huber 回归并提出 AdaOFUL 来解决重尾奖励问题。AdaOFUL 实现了 O~(d(t=1Tνt2)1/2+d)\widetilde{O}\big(d\big(\sum_{t=1}^T \nu_{t}^2\big)^{1/2}+d\big) 的当前最优 regret 界,仿佛奖励是一致有界的,其中 νt2\nu_{t}^2 为第 tt 轮观测到的奖励条件方差,dd 为特征维度,O~()\widetilde{O}(\cdot) 隐藏对数依赖。基于 AdaOFUL,我们为线性 MDP 提出 VARA,其实现了更紧的方差感知 regret 界 O~(dHGK)\widetilde{O}(d\sqrt{HG^*K})。此处 HH 为回合长度,KK 为回合数,GG^* 为一个更小的依赖于实例的量,当 MDP 满足额外结构条件时可由其他依赖于实例的量界定。我们的 regret 界在三个方面优于当前最优界:(1) 它依赖于更紧的依赖于实例的量,且对 ddHH 具有最优依赖;(2) 在 MDP 的额外结构条件下,我们可获得 GG^* 进一步的依赖于实例的界;(3) 我们的 regret 界即使在奖励仅具有限方差时也成立,达到了以往工作未及的普适性。总体而言,我们改进的自适应 Huber 回归算法可作为设计重尾奖励在线问题算法时有用的基本构件。

关键词

引用

@article{arxiv.2303.05606,
  title  = {Variance-aware robust reinforcement learning with linear function approximation under heavy-tailed rewards},
  author = {Xiang Li and Qiang Sun},
  journal= {arXiv preprint arXiv:2303.05606},
  year   = {2023}
}

备注

23 page main text, 42 page appendix