中文

模仿正则化的离线学习

机器学习 2019-01-16 v1 机器学习

摘要

我们研究上下文老虎机模型下自动化决策系统中离线学习的问题。给定由上下文、(随机)动作和非负奖励组成的日志历史数据。一个常见目标是评估在相同上下文中采取不同动作会发生什么,从而相应地优化动作策略。该问题的典型方法,逆概率加权估计(IPWE)[Bottou et al., 2013],需要日志记录的动作概率,而由于工程复杂性,这在实践中可能缺失。即便可用,小的动作概率也会导致IPWE的巨大不确定性,使相应结果不显著。为解决这两个问题,我们展示了如何使用策略改进(PIL)目标,并以策略模仿(IML)正则化。我们通过表明二者均为原始IPWE的下界代理,将PIL作为Clipped-IPWE的扩展来动机与分析。我们还正式将IML与IPWE方差估计[Swaminathan and Joachims 2015]及自然策略梯度相联系。在无概率日志时,我们的PIL-IML解释通过奖励加权证明并改进了预测相同上下文中所有候选动作项的最先进交叉熵(CE)损失。在有概率日志时,我们的主要理论贡献将IML欠拟合与混杂变量或模型误设的存在相联系。我们基于辛普森悖论、标准UCI多类到老虎机转换以及Criteo反事实分析挑战数据集的仿真展示了我们洞见的价值与准确性。

关键词

引用

@article{arxiv.1901.04723,
  title  = {Imitation-Regularized Offline Learning},
  author = {Yifei Ma and Yu-Xiang Wang and Balakrishnan and Narayanaswamy},
  journal= {arXiv preprint arXiv:1901.04723},
  year   = {2019}
}

备注

Accepted for publication at AISTATS 2019