中文

面向无限时域 MDP 的带离线数据集高效在线学习:一种贝叶斯方法

机器学习 2024-02-05 v2 人工智能 系统与控制 系统与控制 机器学习

摘要

在本文中,我们研究在无限时域设定下、以离线数据集为起点时的高效在线强化学习问题。我们假设离线数据集由某专家生成,但其能力水平未知,即它并非完美,也不必然使用最优策略。我们表明,若学习智能体对专家所采用的行为策略(由能力参数参数化)进行建模,则在最小化累积后悔方面可比不建模时表现显著更优。我们建立了精确知情 PSRL 算法的后悔上界,其尺度为 O~(T)\tilde{O}(\sqrt{T})。这需要对无限时域设定下的贝叶斯在线学习算法进行一种新颖的先验依赖型后悔分析。随后我们提出 Informed RLSVI 算法,以高效近似 iPSRL 算法。

关键词

引用

@article{arxiv.2310.11531,
  title  = {Efficient Online Learning with Offline Datasets for Infinite Horizon MDPs: A Bayesian Approach},
  author = {Dengwang Tang and Rahul Jain and Botao Hao and Zheng Wen},
  journal= {arXiv preprint arXiv:2310.11531},
  year   = {2024}
}

备注

22 pages