中文

面向离线深度强化学习的悲观模型选择

机器学习 2021-11-30 v1 人工智能 计算工程、金融与科学 神经与进化计算 系统与控制 系统与控制

摘要

深度强化学习(DRL)在解决诸多应用中的序列决策问题方面展现出巨大潜力。尽管性能可观,将 DRL 部署于真实场景仍存在实际鸿沟。一大主要障碍是导致 DRL 所学策略泛化性差的过拟合问题。特别地,对于使用观测数据的离线 DRL,模型选择因缺乏可用于性能验证的真实标签而十分困难,这与拥有模拟环境在线设定不同。本工作中,我们提出一种具理论保证的离线 DRL 悲观模型选择(PMS)方法,其提供了一个可证明有效的框架,用于在候选模型集中找到最佳策略。我们还提出两种改进方法,以解决 DRL 模型在识别最优策略时的潜在偏差。数值研究证明了我们的方法相对于现有方法的优越性能。

关键词

引用

@article{arxiv.2111.14346,
  title  = {Pessimistic Model Selection for Offline Deep Reinforcement Learning},
  author = {Chao-Han Huck Yang and Zhengling Qi and Yifan Cui and Pin-Yu Chen},
  journal= {arXiv preprint arXiv:2111.14346},
  year   = {2021}
}

备注

Preprint. A non-archival and preliminary venue was presented at NeurIPS 2021 Offline Reinforcement Learning Workshop