面向低秩强化学习的谱逐元素矩阵估计
机器学习
2023-10-31 v2 机器学习
摘要
我们研究具有低秩结构的强化学习(RL)中出现的矩阵估计问题。在低秩老虎机中,待恢复矩阵规定了期望的臂奖励;而对于低秩马尔可夫决策过程(MDP),它可例如刻画 MDP 的转移核。在这两种情况下,矩阵的每个元素都携带重要信息,我们寻求具有低逐元素误差的估计方法。重要的是,这些方法还需适应可用数据中固有的相关性(例如对于 MDP,数据由系统轨迹组成)。我们考察了基于简单谱的矩阵估计方法的性能:我们证明它们能高效恢复矩阵的奇异子空间并展现出近乎最小的逐元素误差。这些关于低秩矩阵估计的新结果使得设计充分利用底层低秩结构的强化学习算法成为可能。我们提供此类算法的两个示例:用于低秩老虎机问题的遗憾最小化算法,以及用于低秩 MDP 中无奖励 RL 的最优策略识别算法。两种算法均给出了最先进的性能保证。
引用
@article{arxiv.2310.06793,
title = {Spectral Entry-wise Matrix Estimation for Low-Rank Reinforcement Learning},
author = {Stefan Stojanovic and Yassir Jedra and Alexandre Proutiere},
journal= {arXiv preprint arXiv:2310.06793},
year = {2023}
}
备注
To appear in NeurIPS 2023