贝叶斯反事实风险最小化
机器学习
2020-04-03 v6 机器学习
摘要
我们提出一种用于从记录_bandit反馈中进行离线学习的反事实风险最小化(CRM)的贝叶斯视角。利用 PAC-Bayesian 分析,我们推导了截断逆倾向得分估计量的新泛化界。我们将该界应用于一类贝叶斯策略,由此启发了一种新颖的、可能数据相关的 CRM 正则化技术。实验结果表明,该技术优于标准 正则化,并且与方差正则化具有竞争力,同时更易于实现且计算更高效。
引用
@article{arxiv.1806.11500,
title = {Bayesian Counterfactual Risk Minimization},
author = {Ben London and Ted Sandler},
journal= {arXiv preprint arXiv:1806.11500},
year = {2020}
}
备注
Extended version of the paper published at the 2019 International Conference on Machine Learning (ICML). Contains some additional citations; fewer deferred proofs; and slightly more detailed analysis. Latest revision fixes the order of authors in a reference