中文

基于学习模型的高效离线策略优化

机器学习 2023-02-16 v2

摘要

MuZero Unplugged 提出了一种从记录数据中离线学习策略的有前景方法。它利用学习模型进行蒙特卡洛树搜索(MCTS),并借助 Reanalyze 算法纯粹从离线数据中学习。为获得良好性能,MCTS 需要准确的学习模型与大量模拟,因而耗费巨大计算时间。本文研究了 MuZero Unplugged 在离线 RL 设定下可能表现不佳的若干假设,包括 1)有限数据覆盖下的学习;2)从随机环境的离线数据中学习;3)给定离线数据时参数化不当的模型;4)低计算预算。我们提出使用正则化一步前瞻方法来应对上述问题。不同于昂贵的 MCTS 规划,我们利用学习模型基于一步展开构建优势估计。策略改进朝向最大化估计优势且对数据集正则化的方向。我们在 BSuite 环境上进行了广泛实证研究以验证假设,随后在 RL Unplugged Atari 基准上运行我们的算法。实验结果显示,即便学习模型不准确,所提方法仍取得稳定性能。在大规模 Atari 基准上,该方法以 43% 的优势超越 MuZero Unplugged。最显著的是,在相同硬件与软件栈下,其仅使用 5.6% 的挂钟时间(即 1 小时)相比 MuZero Unplugged(即 17.8 小时)取得了 150% 的 IQM 归一化分数。我们的实现开源位于 https://github.com/sail-sg/rosmo。

关键词

引用

@article{arxiv.2210.05980,
  title  = {Efficient Offline Policy Optimization with a Learned Model},
  author = {Zichen Liu and Siyi Li and Wee Sun Lee and Shuicheng Yan and Zhongwen Xu},
  journal= {arXiv preprint arXiv:2210.05980},
  year   = {2023}
}

备注

ICLR2023