中文

基于_bandit 反馈的高效反事实学习

机器学习 2018-12-07 v3 人工智能 信息检索 统计方法学 机器学习

摘要

利用 bandit 反馈的批数据做离屏评估与优化,最具统计效率的方式是什么?对于由上下文 bandit 算法生成的日志数据,我们考虑来自反事实策略的期望奖励的离线估计量。我们的估计量被证明在广泛估计量类中具有最低方差,实现了相对于标准估计量的方差缩减。我们随后将估计量应用于由一家大型广告公司改进广告设计。与理论结果一致,相较于最先进的基准,我们的估计量使我们能以更高统计置信度改进现有 bandit 算法。

关键词

引用

@article{arxiv.1809.03084,
  title  = {Efficient Counterfactual Learning from Bandit Feedback},
  author = {Yusuke Narita and Shota Yasui and Kohei Yata},
  journal= {arXiv preprint arXiv:1809.03084},
  year   = {2018}
}

备注

accepted at AAAI 2019