具有低秩结构的离线强化学习的矩阵估计
机器学习
2023-05-26 v1
摘要
我们考虑离线强化学习(RL),其中智能体不与环境交互,必须依赖使用行为策略收集的离线数据。先前工作在待评估目标策略被行为策略覆盖(即目标策略访问的状态-动作对也必须被行为策略访问)时提供策略评估保证。我们表明,当 MDP 具有潜在低秩结构时,该覆盖条件可放宽。基于与具有非均匀观测的加权矩阵补全的联系,我们提出一种离线策略评估算法,利用低秩结构估计未覆盖状态-动作对的价值。我们的算法不需要已知的特征表示,且我们的有限样本误差界涉及一种新颖的差异度量,量化行为策略与目标策略在谱空间中的差异。我们给出具体例子,其中我们的算法在现有覆盖条件不满足时仍实现准确估计。基于上述评估算法,我们进一步设计了一种离线策略优化算法并给出非渐近性能保证。
引用
@article{arxiv.2305.15621,
title = {Matrix Estimation for Offline Reinforcement Learning with Low-Rank Structure},
author = {Xumei Xi and Christina Lee Yu and Yudong Chen},
journal= {arXiv preprint arXiv:2305.15621},
year = {2023}
}