中文

一种用于稀疏强化学习的双重稳健方法

机器学习 2023-10-25 v1 机器学习

摘要

我们提出一种用于情景式稀疏线性马尔可夫决策过程(SMDP)的新后悔最小化算法,其中状态转移分布是观测特征的线性函数。此前唯一已知的SMDP算法需要稀疏性参数的知识以及对未知策略的预言机访问。我们通过将双重稳健方法(该方法允许使用\emph{所有}动作的特征向量)与一种新颖的分析技术(使算法能利用所有情景中所有时段的数据)相结合,克服了这些限制。所提算法的后悔界为 O~(σmin1sHN)\tilde{O}(\sigma^{-1}_{\min} s_{\star} H \sqrt{N}),其中 σmin\sigma_{\min} 表示特征向量平均Gram矩阵的最小限制特征值,ss_\star 为稀疏性参数,HH 为情景长度,NN 为轮数。我们给出了在一个新识别的SMDP子类上与上界仅差对数因子的下后悔界。我们的数值实验支持了理论结果并展示了算法的优越性能。

关键词

引用

@article{arxiv.2310.15286,
  title  = {A Doubly Robust Approach to Sparse Reinforcement Learning},
  author = {Wonyoung Kim and Garud Iyengar and Assaf Zeevi},
  journal= {arXiv preprint arXiv:2310.15286},
  year   = {2023}
}