论折扣因子在离线强化学习中的作用
机器学习
2022-06-16 v2
摘要
离线强化学习(RL)能够从先前收集的数据中有效学习而无需探索,在探索代价高昂甚至不可行的真实世界应用中展现出巨大前景。折扣因子在提升在线RL样本效率与估计精度方面起着至关重要的作用,但其在离线RL中的作用尚未被充分探究。本文通过理论分析考察了在离线RL中的两种不同效应,即正则化效应与悲观效应。一方面,是在现有离线技术之上权衡最优性与样本效率的调节器。另一方面,较低的引导也可视为一种悲观方式,即我们在最坏可能模型下优化策略性能。我们通过表格型MDP与标准D4RL任务实证验证了上述理论观察。结果表明,折扣因子在离线RL算法性能中扮演关键角色,无论是在现有离线方法下的小数据场景,还是在没有其他保守方法的大数据场景中皆然。
引用
@article{arxiv.2206.03383,
title = {On the Role of Discount Factor in Offline Reinforcement Learning},
author = {Hao Hu and Yiqin Yang and Qianchuan Zhao and Chongjie Zhang},
journal= {arXiv preprint arXiv:2206.03383},
year = {2022}
}
备注
Thirty-ninth International Conference on Machine Learning