EE-Net:上下文老虎机中的利用-探索神经网络
机器学习
2022-05-16 v8 机器学习
摘要
本文提出一种上下文老虎机中的新型神经探索策略 EE-Net,不同于标准的基于 UCB 与基于 TS 的方法。上下文多臂老虎机已被研究数十年,并有多种应用。为解决老虎机中的利用-探索权衡,主要有三种技术:epsilon-greedy、Thompson Sampling(TS)和 Upper Confidence Bound(UCB)。在近期文献中,线性上下文老虎机采用岭回归估计奖励函数,并结合 TS 或 UCB 策略进行探索。然而,这类工作显式假设奖励基于臂向量的线性函数,而真实世界数据集可能并非如此。为克服该挑战,一系列神经老虎机算法被提出,其中使用神经网络学习底层奖励函数,并适配 TS 或 UCB 进行探索。与以往方法计算基于大偏差的统计界进行探索不同,我们提出“EE-Net”,一种基于神经网络的新型探索策略。除使用神经网络(利用网络)学习奖励函数外,EE-Net 使用另一神经网络(探索网络)自适应学习与当前估计奖励相比的潜在增益以用于探索。随后,构建决策器以结合利用网络与探索网络的输出。我们证明 EE-Net 可达到 后悔界,并表明 EE-Net 在真实世界数据集上优于现有的线性和神经上下文老虎机基线。
引用
@article{arxiv.2110.03177,
title = {EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits},
author = {Yikun Ban and Yuchen Yan and Arindam Banerjee and Jingrui He},
journal= {arXiv preprint arXiv:2110.03177},
year = {2022}
}
备注
Published on ICLR 2022