混杂马尔可夫决策过程中带工具变量的离线强化学习
机器学习
2022-09-20 v1 统计方法学
摘要
我们研究存在未观测混杂因素时的离线强化学习(RL)。由于缺乏与环境的在线交互,离线RL面临以下两个重大挑战:(i)智能体可能被未观测状态变量所混杂;(ii)先前收集的离线数据对环境未提供充分的覆盖。为应对上述挑战,我们借助工具变量研究混杂MDP中的策略学习。具体而言,我们首先建立了混杂MDP中期望总回报基于值函数(VF)和边缘化重要性采样(MIS)的辨识结果。随后,通过利用悲观原理和我们的辨识结果,我们提出了多种策略学习方法,在最小数据覆盖与建模假设下具有寻找最优类内策略的有限样本次优性保证。最后,我们广泛的理论研究以及一项受肾移植启发的数值研究证明了所提方法的前景。
引用
@article{arxiv.2209.08666,
title = {Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes},
author = {Zuyue Fu and Zhengling Qi and Zhaoran Wang and Zhuoran Yang and Yanxun Xu and Michael R. Kosorok},
journal= {arXiv preprint arXiv:2209.08666},
year = {2022}
}