重尾奖励下基于线性函数近似的方差感知鲁棒强化学习
机器学习
2023-03-15 v2 人工智能
统计理论
机器学习
统计理论
摘要
本文针对仅具有有限方差的重尾奖励,提出了两种用于在线序贯决策的算法 AdaOFUL 与 VARA。对于线性随机 bandit,我们通过改进自适应 Huber 回归并提出 AdaOFUL 来解决重尾奖励问题。AdaOFUL 实现了 的当前最优 regret 界,仿佛奖励是一致有界的,其中 为第 轮观测到的奖励条件方差, 为特征维度, 隐藏对数依赖。基于 AdaOFUL,我们为线性 MDP 提出 VARA,其实现了更紧的方差感知 regret 界 。此处 为回合长度, 为回合数, 为一个更小的依赖于实例的量,当 MDP 满足额外结构条件时可由其他依赖于实例的量界定。我们的 regret 界在三个方面优于当前最优界:(1) 它依赖于更紧的依赖于实例的量,且对 和 具有最优依赖;(2) 在 MDP 的额外结构条件下,我们可获得 进一步的依赖于实例的界;(3) 我们的 regret 界即使在奖励仅具有限方差时也成立,达到了以往工作未及的普适性。总体而言,我们改进的自适应 Huber 回归算法可作为设计重尾奖励在线问题算法时有用的基本构件。
引用
@article{arxiv.2303.05606,
title = {Variance-aware robust reinforcement learning with linear function approximation under heavy-tailed rewards},
author = {Xiang Li and Qiang Sun},
journal= {arXiv preprint arXiv:2303.05606},
year = {2023}
}
备注
23 page main text, 42 page appendix