具有延迟反馈的平滑序贯优化
机器学习
2021-06-23 v2
摘要
反馈中的随机延迟导致使用多臂老虎机的序贯学习不稳定。近来,经验贝叶斯收缩被证明可改善老虎机学习中的奖励估计。在此,我们提出一种对收缩的新颖改造,从加窗累积输入估计平滑的奖励估计,以处理来自延迟反馈和不平稳奖励的不完整知识。通过数值模拟,我们表明该改造保留了收缩的益处,并将奖励估计的稳定性提高了 50% 以上。我们的方案将最优臂上的处理分配变异性降低至多 3.8 倍,并改善统计准确性——真阳性率提高至多 8%,假阳性率降低 37%。这些优势共同实现了对适应速度与稳定性之间权衡的控制,并促进了人在回路的序贯优化。
引用
@article{arxiv.2106.11294,
title = {Smooth Sequential Optimisation with Delayed Feedback},
author = {Srivas Chennu and Jamie Martin and Puli Liyanagama and Phil Mohr},
journal= {arXiv preprint arXiv:2106.11294},
year = {2021}
}
备注
Workshop on Bayesian causal inference for real world interactive systems, 27th SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2021)