线性 MDP 中的强化学习:常数后悔与表示选择
机器学习
2021-10-29 v1
摘要
我们研究了在具有线性结构的有限时域马尔可夫决策过程(MDPs)中,状态-动作值函数表示在后悔最小化中的作用。我们首先推导出表示的一个必要条件,称为普适跨越最优特征(UNISOFT),以在任何具有线性奖励函数的 MDP 中实现常数后悔。该结果涵盖了低秩 MDP 以及更一般的零固有贝尔曼误差(亦称贝尔曼闭包假设)等已知设定。随后我们证明,对于这两类问题该条件也是充分的——我们为两种乐观算法(LSVI-UCB 和 ELEANOR)推导出了常数后悔界。最后,我们提出一种表示选择算法,并证明当给定表示之一或它们的合适组合满足 UNISOFT 条件时,该算法可实现常数后悔。
引用
@article{arxiv.2110.14798,
title = {Reinforcement Learning in Linear MDPs: Constant Regret and Representation Selection},
author = {Matteo Papini and Andrea Tirinzoni and Aldo Pacchiano and Marcello Restelli and Alessandro Lazaric and Matteo Pirotta},
journal= {arXiv preprint arXiv:2110.14798},
year = {2021}
}
备注
Accepted at NeurIPS 2021