面向因果离线强化学习的工具变量值迭代
机器学习
2024-10-16 v3 机器学习
摘要
在离线强化学习(RL)中,最优策略仅从先验收集的观察数据中学习。然而,在观察数据中,动作常受未观测变量混杂。工具变量(IVs)在 RL 语境下是指其对状态变量的影响完全由动作中介的变量。当存在有效工具时,我们可通过观察数据恢复被混杂的转移动态。我们研究了一类转移动态具有加性非线性函数形式的混杂马尔可夫决策过程。利用 IVs,我们导出一个条件矩限制,据此可基于观察数据辨识转移动态。我们提出了一种可证明高效的 IV 辅助值迭代(IVVI)算法,其基于条件矩限制的 primal-dual 重构。据我们所知,这是首个可证明高效的工具辅助离线 RL 算法。
引用
@article{arxiv.2102.09907,
title = {Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning},
author = {Luofeng Liao and Zuyue Fu and Zhuoran Yang and Yixin Wang and Mladen Kolar and Zhaoran Wang},
journal= {arXiv preprint arXiv:2102.09907},
year = {2024}
}
备注
under review