面向含混杂偏差与缺失观测的上下文老虎机策略学习统一框架
机器学习
2023-03-21 v1 人工智能
机器学习
摘要
我们研究离线上下文老虎机问题,旨在利用观测数据获取最优策略。然而,该数据通常存在两种缺陷:(i)某些混杂动作的变量未被观测到;(ii)所收集数据中存在缺失观测。未观测混杂因子导致混杂偏差,而缺失观测引起偏差与低效问题。为克服这些挑战并从观测数据集中学习最优策略,我们提出一种称为因果调整悲观(CAP)策略学习的新算法,其将奖励函数构造为积分方程组的解,构建置信集,并以悲观方式贪心选取动作。在对数据作出温和假设下,我们给出了 CAP 在离线上下文老虎机问题中次优性的上界。
引用
@article{arxiv.2303.11187,
title = {A Unified Framework of Policy Learning for Contextual Bandit with Confounding Bias and Missing Observations},
author = {Siyu Chen and Yitan Wang and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2303.11187},
year = {2023}
}
备注
76 page, 5 figures