中文

基于高效鲁棒信赖域优化的强化学习价值提升

机器学习 2023-01-06 v1 机器学习

摘要

强化学习(RL)是一种强大的机器学习技术,使智能体能够学习在序贯决策中最大化累积奖励的最优策略。现有文献中的大多数方法都是在数据易于收集或模拟的在线设定下开发的。受移动健康研究等数据有限且预先收集的高风险领域启发,本文研究离线强化学习方法。为高效利用这些数据集进行策略优化,我们提出一种新颖的价值提升方法,以改进由现有最先进RL算法计算得到的给定初始策略的性能。具体而言,当初始策略不一致时,我们的方法将输出一个价值不差于且通常优于初始策略的策略。当初始策略一致时,在某些温和条件下,我们的方法将产生一个价值以比初始策略更快的速率收敛到最优策略的策略,从而实现期望的“价值提升”性质。所提方法通常适用于属于某预指定函数类(例如深度神经网络)的任意参数化策略。我们进行了广泛的数值研究以证明方法的优越性能。

关键词

引用

@article{arxiv.2301.02220,
  title  = {Value Enhancement of Reinforcement Learning via Efficient and Robust Trust Region Optimization},
  author = {Chengchun Shi and Zhengling Qi and Jianing Wang and Fan Zhou},
  journal= {arXiv preprint arXiv:2301.02220},
  year   = {2023}
}