具有连续动作的拟最优强化学习
机器学习
2023-10-03 v2 机器学习
统计方法学
摘要
强化学习(RL)的许多现实应用需要在连续动作环境中进行决策。特别是,确定最优剂量水平在开发医疗治疗方案中起着至关重要的作用。然而,将现有RL算法适配到医疗应用中的一个挑战是,流行的无限支撑随机策略(例如高斯策略)可能会分配危险的高剂量并严重伤害患者。因此,诱导一类其支撑仅包含近最优动作的策略,并缩小动作搜索区域以提高有效性和可靠性十分重要。为此,我们开发了一种新颖的拟最优学习算法(quasi-optimal learning algorithm),该算法可在离屏(off-policy)设定下轻松优化,并在一般函数逼近下具有保证的收敛性。理论上,我们分析了所提算法的一致性、样本复杂度、适应性和收敛性。我们通过全面的模拟实验以及针对Ohio Type 1糖尿病数据集的剂量建议实际应用来评估我们的算法。
引用
@article{arxiv.2301.08940,
title = {Quasi-optimal Reinforcement Learning with Continuous Actions},
author = {Yuhan Li and Wenzhuo Zhou and Ruoqing Zhu},
journal= {arXiv preprint arXiv:2301.08940},
year = {2023}
}
备注
The first two authors contributed equally to this work