GuideBoot:面向深度上下文_bandit的引导式Bootstrap
机器学习
2021-07-20 v1 信息检索
摘要
探索/利用(E&E)困境处于在线广告等交互系统的核心,为此已提出上下文_bandit算法。贝叶斯方法通过原则性不确定性估计提供引导式探索,但其适用性常因过度简化的假设而受限。另一方面,非贝叶斯bootstrap方法可通过使用深度奖励模型应用于复杂问题,但缺乏对探索行为的明确引导。开发一种面向复杂深度上下文_bandit的实用方法在很大程度上仍未解决。本文中,我们提出引导式Bootstrap(简称GuideBoot),结合了两者优势。GuideBoot通过对真实样本与带伪标签的噪声样本训练多个模型,其中噪声依据预测不确定性添加,从而为探索行为提供显式引导。所提方法高效,因仅利用一个随机选定模型即可在线决策;同时也有效,因为我们证明其可视为Thompson采样的非贝叶斯近似。此外,我们将其扩展为仅从流式数据学习的在线版本,这在实际应用中备受青睐。在合成任务与大规模广告环境下的广泛实验表明,GuideBoot相较先前最先进方法取得了显著提升。
引用
@article{arxiv.2107.08383,
title = {GuideBoot: Guided Bootstrap for Deep Contextual Bandits},
author = {Feiyang Pan and Haoming Li and Xiang Ao and Wei Wang and Yanrong Kang and Ao Tan and Qing He},
journal= {arXiv preprint arXiv:2107.08383},
year = {2021}
}
备注
WWW-2021