中文

大动作空间中的非线性强化学习:结构条件与后验采样的样本效率

机器学习 2024-08-09 v2 人工智能

摘要

具有丰富观测和函数逼近的可证明样本高效强化学习(RL)近期取得了巨大进展,尤其当底层函数逼近器为线性时。在这一线性情形下,存在计算与统计高效的方法,其中潜在无限的状态与动作空间可通过已知特征嵌入刻画,样本复杂度随这些特征的(内蕴)维度缩放。当动作空间有限时,更精细的结果在底层 RL 问题的适当结构约束下允许非线性函数逼近,例如可学习优良特征而无需假设已获取它们。本工作中,我们给出了首个在线性可嵌入条件(推广了所有线性与有限动作设定)下适用于一般动作空间的非线性函数逼近结果。我们为此类问题设计了一种新颖的乐观后验采样策略 TS^3,并给出了最坏情况样本复杂度保证,其随 RL 问题的秩参数、本工作引入的线性嵌入维度以及函数类复杂度的标准度量而缩放。

关键词

引用

@article{arxiv.2203.08248,
  title  = {Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling},
  author = {Alekh Agarwal and Tong Zhang},
  journal= {arXiv preprint arXiv:2203.08248},
  year   = {2024}
}

备注

Fixes an error in the earlier version in the proof of Proposition 13