基于指数族模型的通过得分匹配的强化学习
机器学习
2023-01-10 v2 机器学习
摘要
我们提出一种乐观的基于模型的算法,称为 SMRL,用于有限时域片段式强化学习(RL),其中转移模型由具有 个参数的指数族分布指定,且奖励有界且已知。SMRL 使用得分匹配——一种非归一化密度估计技术,可通过岭回归高效估计模型参数。在标准正则性假设下,SMRL 实现了 的在线后悔界,其中 为每个片段的长度, 为总交互次数(忽略对结构尺度参数的多项式依赖)。
引用
@article{arxiv.2112.14195,
title = {Exponential Family Model-Based Reinforcement Learning via Score Matching},
author = {Gene Li and Junbo Li and Anmol Kabra and Nathan Srebro and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2112.14195},
year = {2023}
}
备注
NeurIPS 2022