基于_bandit 反馈的高效反事实学习
机器学习
2018-12-07 v3 人工智能
信息检索
统计方法学
机器学习
摘要
利用 bandit 反馈的批数据做离屏评估与优化,最具统计效率的方式是什么?对于由上下文 bandit 算法生成的日志数据,我们考虑来自反事实策略的期望奖励的离线估计量。我们的估计量被证明在广泛估计量类中具有最低方差,实现了相对于标准估计量的方差缩减。我们随后将估计量应用于由一家大型广告公司改进广告设计。与理论结果一致,相较于最先进的基准,我们的估计量使我们能以更高统计置信度改进现有 bandit 算法。
引用
@article{arxiv.1809.03084,
title = {Efficient Counterfactual Learning from Bandit Feedback},
author = {Yusuke Narita and Shota Yasui and Kohei Yata},
journal= {arXiv preprint arXiv:1809.03084},
year = {2018}
}
备注
accepted at AAAI 2019