面向离线强化学习中无超参数策略选择的研究
机器学习
2021-11-04 v3 人工智能
机器学习
摘要
在离线强化学习(RL)中,如何在不同训练算法产生的策略与值函数之间进行选择——这对超参数调优至关重要——是一个重要的开放问题。现有基于离策略评估(OPE)的方法往往需要额外的函数逼近因而需要超参数,造成了鸡生蛋蛋生鸡的困境。在本文中,我们基于 BVFT [XJ21](值函数选择方面近期的理论进展)设计了用于策略选择的无超参数算法,并展示了它们在 Atari 等离散动作基准上的有效性。为应对连续动作域中因劣质评论家导致的性能退化,我们进一步将 BVFT 与 OPE 结合以兼取两者之长,并作为副产物获得了一种具有理论保证的基于 Q 函数的 OPE 超参数调优方法。
引用
@article{arxiv.2110.14000,
title = {Towards Hyperparameter-free Policy Selection for Offline Reinforcement Learning},
author = {Siyuan Zhang and Nan Jiang},
journal= {arXiv preprint arXiv:2110.14000},
year = {2021}
}
备注
NeurIPS 2021