中文

论折扣因子在离线强化学习中的作用

机器学习 2022-06-16 v2

摘要

离线强化学习(RL)能够从先前收集的数据中有效学习而无需探索,在探索代价高昂甚至不可行的真实世界应用中展现出巨大前景。折扣因子γ\gamma在提升在线RL样本效率与估计精度方面起着至关重要的作用,但其在离线RL中的作用尚未被充分探究。本文通过理论分析考察了γ\gamma在离线RL中的两种不同效应,即正则化效应与悲观效应。一方面,γ\gamma是在现有离线技术之上权衡最优性与样本效率的调节器。另一方面,较低的引导γ\gamma也可视为一种悲观方式,即我们在最坏可能模型下优化策略性能。我们通过表格型MDP与标准D4RL任务实证验证了上述理论观察。结果表明,折扣因子在离线RL算法性能中扮演关键角色,无论是在现有离线方法下的小数据场景,还是在没有其他保守方法的大数据场景中皆然。

关键词

引用

@article{arxiv.2206.03383,
  title  = {On the Role of Discount Factor in Offline Reinforcement Learning},
  author = {Hao Hu and Yiqin Yang and Qianchuan Zhao and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2206.03383},
  year   = {2022}
}

备注

Thirty-ninth International Conference on Machine Learning