中文

具有轨迹级奖励的可证明高效离线强化学习

机器学习 2023-04-20 v2 机器学习

摘要

强化学习(RL)的显著成功严重依赖于观测每个访问状态-动作对的奖励。然而,在许多现实应用中,智能体只能观测代表整条轨迹质量的分数,称为{\em 轨迹级奖励}。在此情形下,标准 RL 方法难以充分利用轨迹级奖励,且策略评估中会产生较大偏差与方差误差。本工作中,我们提出一种新颖的离线 RL 算法,称为基于奖励分解的悲观值迭代(PARTED),其通过基于最小二乘的奖励重分配将轨迹回报分解为逐步代理奖励,然后基于所学代理奖励执行悲观值迭代。为确保 PARTED 构造的值函数相对于最优值函数始终悲观,我们设计了一个新的惩罚项以抵消代理奖励的不确定性。对于具有大状态空间的一般片段式 MDP,我们证明采用过参数化神经网络函数近似的 PARTED 达到了 O~(DeffH2/N)\tilde{\mathcal{O}}(D_{\text{eff}}H^2/\sqrt{N}) 的次优性,其中 HH 为片段长度,NN 为样本总数,DeffD_{\text{eff}} 为神经正切核矩阵的有效维度。为进一步阐明该结果,我们证明在线性 MDP 下 PARTED 达到了 O~(dH3/N)\tilde{\mathcal{O}}(dH^3/\sqrt{N}) 的次优性,其中 dd 为特征维度,当 Deff=dHD_{\text{eff}}=dH 时与神经网络函数近似的结果一致。据我们所知,PARTED 是首个在具有轨迹级奖励的一般 MDP 中被证明高效的离线 RL 算法。

关键词

引用

@article{arxiv.2206.06426,
  title  = {Provably Efficient Offline Reinforcement Learning with Trajectory-Wise Reward},
  author = {Tengyu Xu and Yue Wang and Shaofeng Zou and Yingbin Liang},
  journal= {arXiv preprint arXiv:2206.06426},
  year   = {2023}
}

备注

Submitted for IEEE Transactions on Information Theory