基于归约的保守型多臂老虎机与强化学习框架
机器学习
2022-03-17 v2 机器学习
摘要
本文提出一个基于归约的保守型多臂老虎机与强化学习(RL)框架,其核心技术是计算运行基线策略所获得的必要且充分的预算。对于下界,我们改进了现有的保守型多臂老虎机下界,并通过黑盒归约将非保守设定下的某一下界转化为保守设定下的新下界,从而得到保守型线性老虎机、表格型RL和低秩MDP的新下界。对于上界,在多臂老虎机、线性老虎机和表格型RL中,我们的新上界以显著更简单的分析收紧或匹配现有结果。我们还得到了保守型低秩MDP的新上界。
引用
@article{arxiv.2106.11692,
title = {A Reduction-Based Framework for Conservative Bandits and Reinforcement Learning},
author = {Yunchang Yang and Tianhao Wu and Han Zhong and Evrard Garcelon and Matteo Pirotta and Alessandro Lazaric and Liwei Wang and Simon S. Du},
journal= {arXiv preprint arXiv:2106.11692},
year = {2022}
}