面向离线深度强化学习的悲观模型选择
机器学习
2021-11-30 v1 人工智能
计算工程、金融与科学
神经与进化计算
系统与控制
系统与控制
摘要
深度强化学习(DRL)在解决诸多应用中的序列决策问题方面展现出巨大潜力。尽管性能可观,将 DRL 部署于真实场景仍存在实际鸿沟。一大主要障碍是导致 DRL 所学策略泛化性差的过拟合问题。特别地,对于使用观测数据的离线 DRL,模型选择因缺乏可用于性能验证的真实标签而十分困难,这与拥有模拟环境在线设定不同。本工作中,我们提出一种具理论保证的离线 DRL 悲观模型选择(PMS)方法,其提供了一个可证明有效的框架,用于在候选模型集中找到最佳策略。我们还提出两种改进方法,以解决 DRL 模型在识别最优策略时的潜在偏差。数值研究证明了我们的方法相对于现有方法的优越性能。
引用
@article{arxiv.2111.14346,
title = {Pessimistic Model Selection for Offline Deep Reinforcement Learning},
author = {Chao-Han Huck Yang and Zhengling Qi and Yifan Cui and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2111.14346},
year = {2021}
}
备注
Preprint. A non-archival and preliminary venue was presented at NeurIPS 2021 Offline Reinforcement Learning Workshop