具有轨迹级奖励的可证明高效离线强化学习
机器学习
2023-04-20 v2 机器学习
摘要
强化学习(RL)的显著成功严重依赖于观测每个访问状态-动作对的奖励。然而,在许多现实应用中,智能体只能观测代表整条轨迹质量的分数,称为{\em 轨迹级奖励}。在此情形下,标准 RL 方法难以充分利用轨迹级奖励,且策略评估中会产生较大偏差与方差误差。本工作中,我们提出一种新颖的离线 RL 算法,称为基于奖励分解的悲观值迭代(PARTED),其通过基于最小二乘的奖励重分配将轨迹回报分解为逐步代理奖励,然后基于所学代理奖励执行悲观值迭代。为确保 PARTED 构造的值函数相对于最优值函数始终悲观,我们设计了一个新的惩罚项以抵消代理奖励的不确定性。对于具有大状态空间的一般片段式 MDP,我们证明采用过参数化神经网络函数近似的 PARTED 达到了 的次优性,其中 为片段长度, 为样本总数, 为神经正切核矩阵的有效维度。为进一步阐明该结果,我们证明在线性 MDP 下 PARTED 达到了 的次优性,其中 为特征维度,当 时与神经网络函数近似的结果一致。据我们所知,PARTED 是首个在具有轨迹级奖励的一般 MDP 中被证明高效的离线 RL 算法。
引用
@article{arxiv.2206.06426,
title = {Provably Efficient Offline Reinforcement Learning with Trajectory-Wise Reward},
author = {Tengyu Xu and Yue Wang and Shaofeng Zou and Yingbin Liang},
journal= {arXiv preprint arXiv:2206.06426},
year = {2023}
}
备注
Submitted for IEEE Transactions on Information Theory