中文

样本选择偏差下的离策略学习泛化

机器学习 2021-12-03 v1 机器学习

摘要

学习可泛化到目标人群的个性化决策策略具有重大意义。由于训练数据往往不能代表目标人群,标准的策略学习方法可能产生无法泛化到目标人群的策略。为应对这一挑战,我们提出了一种学习可泛化到目标人群的策略的新框架。为此,我们使用一个选择变量将训练数据与目标人群之间的差异刻画为样本选择偏差。在该选择变量的不确定性集上,我们优化策略的极小极大值,以在目标人群上获得最佳最坏情况策略值。为解决极小极大问题,我们推导了一种基于凸-凹过程的的高效算法,并证明了其在如 logistic 策略等参数化策略空间上的收敛性。我们证明,若不确定性集设定良好,我们的策略可泛化到目标人群,因为它们不会比在训练数据上表现更差。利用模拟数据和一项临床试验,我们证明与标准策略学习方法相比,我们的框架显著提升了策略的泛化能力。

关键词

引用

@article{arxiv.2112.01387,
  title  = {Generalizing Off-Policy Learning under Sample Selection Bias},
  author = {Tobias Hatt and Daniel Tschernutter and Stefan Feuerriegel},
  journal= {arXiv preprint arXiv:2112.01387},
  year   = {2021}
}