中文

一般函数近似强化学习的无界且实例依赖的遗憾界

机器学习 2023-12-08 v1 机器学习

摘要

为了解决一般函数近似强化学习中的长规划界问题,我们提出了首个算法,称为UCRL-WVTR,该算法同时实现了无界和实例依赖,因为它消除了对规划界的多项式依赖。推导出的遗憾界被认为是精确的,因为当特化到线性混合MDP时,它与极小极大下界匹配,仅相差对数因子。此外,UCRL-WVTR在访问回归预言机的情况下是计算高效的。实现这种无界、实例依赖且精确的遗憾界取决于:(i)新颖的算法设计:在一般函数近似背景下的加权值目标回归和高阶矩估计器;以及(ii)细粒度分析:加权非线性最小二乘的新型集中界以及导致紧致实例依赖界的精炼分析。我们还进行了全面的实验来证实我们的理论发现。

关键词

引用

@article{arxiv.2312.04464,
  title  = {Horizon-Free and Instance-Dependent Regret Bounds for Reinforcement Learning with General Function Approximation},
  author = {Jiayi Huang and Han Zhong and Liwei Wang and Lin F. Yang},
  journal= {arXiv preprint arXiv:2312.04464},
  year   = {2023}
}