中文

具有低秩结构的离线强化学习的矩阵估计

机器学习 2023-05-26 v1

摘要

我们考虑离线强化学习(RL),其中智能体不与环境交互,必须依赖使用行为策略收集的离线数据。先前工作在待评估目标策略被行为策略覆盖(即目标策略访问的状态-动作对也必须被行为策略访问)时提供策略评估保证。我们表明,当 MDP 具有潜在低秩结构时,该覆盖条件可放宽。基于与具有非均匀观测的加权矩阵补全的联系,我们提出一种离线策略评估算法,利用低秩结构估计未覆盖状态-动作对的价值。我们的算法不需要已知的特征表示,且我们的有限样本误差界涉及一种新颖的差异度量,量化行为策略与目标策略在谱空间中的差异。我们给出具体例子,其中我们的算法在现有覆盖条件不满足时仍实现准确估计。基于上述评估算法,我们进一步设计了一种离线策略优化算法并给出非渐近性能保证。

关键词

引用

@article{arxiv.2305.15621,
  title  = {Matrix Estimation for Offline Reinforcement Learning with Low-Rank Structure},
  author = {Xumei Xi and Christina Lee Yu and Yudong Chen},
  journal= {arXiv preprint arXiv:2305.15621},
  year   = {2023}
}