策略保守Q学习
机器学习
2024-06-10 v1
摘要
离线强化学习是一种引人注目的范式,它通过利用预先收集的静态数据集来扩展强化学习的实际效用,从而避免了与收集在线交互相关的限制。离线强化学习的主要困难在于,当遇到分布外动作时,如何减轻近似误差的影响;处理不当会导致策略偏好分布外动作,这可能带来意想不到甚至灾难性的后果。尽管已有多种工作旨在解决此问题,但它们往往在分布外区域及其附近过度抑制价值函数,导致过于悲观的价值估计。在本文中,我们提出了一种名为“策略保守Q学习”的新框架,该框架区分了易于估计和难以估计的分布外数据,最终得到不那么保守的价值估计。我们的方法利用了神经网络在插值方面的固有优势,同时谨慎地处理其在外推方面的局限性,以获得悲观但仍具有良好校准性的价值估计。理论分析也表明,SCQ学习到的价值函数仍然是保守的,但可能比保守Q学习保守得多。最后,在D4RL基准任务上的广泛评估表明,我们提出的方法优于最先进的方法。我们的代码可通过\url{https://github.com/purewater0901/SCQ}获取。
引用
@article{arxiv.2406.04534,
title = {Strategically Conservative Q-Learning},
author = {Yutaka Shimizu and Joey Hong and Sergey Levine and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:2406.04534},
year = {2024}
}