因果强化学习中离线策略评估的双向去混杂因子方法
机器学习
2024-12-10 v1 机器学习
摘要
本文研究了在存在未测量混杂因子情况下的离线策略评估。借鉴面板数据文献中广泛使用的双向固定效应回归模型,我们提出了一个双向未测量混杂假设来模拟因果强化学习中的系统动力学,并开发了一个双向去混杂因子算法,该算法设计了一个神经张量网络来同时学习未测量混杂因子和系统动力学,基于此可以构建一个基于模型的估计器,用于一致的策略价值估计。我们通过理论结果和数值实验说明了所提出估计器的有效性。
引用
@article{arxiv.2412.05783,
title = {Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning},
author = {Shuguang Yu and Shuxing Fang and Ruixin Peng and Zhengling Qi and Fan Zhou and Chengchun Shi},
journal= {arXiv preprint arXiv:2412.05783},
year = {2024}
}