通过值函数的双侧界利用强化学习中的先验知识
机器学习
2023-09-06 v2
摘要
智能体利用过去经验的能力对于高效求解新任务至关重要。如迁移学习、课程学习和组合性研究所示,新任务的近似解可从先前导出的值函数获得。然而,先前工作主要关注使用值函数对新任务的求解获得零样本近似。在本文中,我们展示了如何将值函数的任意近似用于推导所关注最优值函数的双侧界。我们进一步将该框架推广到连续状态和动作空间下的误差分析。推导结果带来了训练过程中裁剪的新方法,并在简单域中进行了数值验证。
引用
@article{arxiv.2302.09676,
title = {Leveraging Prior Knowledge in Reinforcement Learning via Double-Sided Bounds on the Value Function},
author = {Jacob Adamczyk and Stas Tiomkin and Rahul Kulkarni},
journal= {arXiv preprint arXiv:2302.09676},
year = {2023}
}