中文

基于指数族模型的通过得分匹配的强化学习

机器学习 2023-01-10 v2 机器学习

摘要

我们提出一种乐观的基于模型的算法,称为 SMRL,用于有限时域片段式强化学习(RL),其中转移模型由具有 dd 个参数的指数族分布指定,且奖励有界且已知。SMRL 使用得分匹配——一种非归一化密度估计技术,可通过岭回归高效估计模型参数。在标准正则性假设下,SMRL 实现了 O~(dH3T)\tilde O(d\sqrt{H^3T}) 的在线后悔界,其中 HH 为每个片段的长度,TT 为总交互次数(忽略对结构尺度参数的多项式依赖)。

关键词

引用

@article{arxiv.2112.14195,
  title  = {Exponential Family Model-Based Reinforcement Learning via Score Matching},
  author = {Gene Li and Junbo Li and Anmol Kabra and Nathan Srebro and Zhaoran Wang and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2112.14195},
  year   = {2023}
}

备注

NeurIPS 2022