中文

乐观模型推演用于悲观离线策略优化

机器学习 2024-01-12 v1

摘要

基于模型的离线强化学习(RL)已取得显著进展,为通过合成模型推演提升泛化能力提供了有前景的途径。现有工作主要侧重于在策略优化中引入悲观主义,通常通过构建悲观马尔可夫决策过程(P-MDP)来实现。然而,P-MDP 阻止策略在离线数据集支持范围之外的分布外(OOD)区域进行学习,这可能未能充分利用动力学模型的泛化能力。与此相反,我们提出构建乐观 MDP(O-MDP)。我们初步观察到,通过鼓励更多 OOD 推演,乐观主义可能带来益处。受此观察启发,我们提出了 ORPO,一个简单而有效的基于模型的离线 RL 框架。ORPO 为悲观离线策略优化生成乐观模型推演。具体而言,我们在 O-MDP 中训练一个乐观推演策略,以采样更多 OOD 模型推演。然后,我们用惩罚奖励重新标记采样的状态-动作对,并在 P-MDP 中优化输出策略。理论上,我们证明了在线性 MDP 中,使用 ORPO 训练的策略性能存在下界。实验结果表明,我们的框架以 30% 的优势显著优于 P-MDP 基线,在广泛使用的基准上达到了最先进的性能。此外,ORPO 在需要泛化的问题中展现出显著优势。

关键词

引用

@article{arxiv.2401.05899,
  title  = {Optimistic Model Rollouts for Pessimistic Offline Policy Optimization},
  author = {Yuanzhao Zhai and Yiying Li and Zijian Gao and Xudong Gong and Kele Xu and Dawei Feng and Ding Bo and Huaimin Wang},
  journal= {arXiv preprint arXiv:2401.05899},
  year   = {2024}
}