中文

基于奖励-相关性滤波的线性离线强化学习

机器学习 2024-01-24 v1 机器学习 最优化与控制

摘要

本文研究在具有决策论稀疏性而非估计稀疏性的设定下,使用线性函数近似的离线强化学习。数据生成过程的结构性限制假定状态转移可分解为一个影响奖励的稀疏成分,以及可能影响但不影响奖励的额外外生动态。尽管用于估计全状态转移属性的最小充分调整集依赖于整个状态,但最优策略以及状态-动作价值函数仅依赖于该稀疏成分:我们称之为因果/决策论稀疏性。我们开发了一种方法,通过在最小二乘策略评估中改进阈值化套索,将状态-动作价值函数的估计进行奖励滤波,使其聚焦于该稀疏成分。我们为我们的奖励滤波线性拟合Q迭代提供了理论保证,其样本复杂度仅取决于稀疏成分的大小。

关键词

引用

@article{arxiv.2401.12934,
  title  = {Reward-Relevance-Filtered Linear Offline Reinforcement Learning},
  author = {Angela Zhou},
  journal= {arXiv preprint arXiv:2401.12934},
  year   = {2024}
}

备注

conference version accepted at AISTATS 2024