通过线性扰动损失最小化进行探索
机器学习
2024-03-07 v2 机器学习
摘要
我们提出通过线性损失扰动进行探索(EVILL),这是一种用于结构化随机_bandit问题的随机化探索方法,其通过求解线性扰动的正则化负对数似然函数的最小化器来工作。我们证明,对于广义线性_bandit的情形,EVILL可归约为扰动历史探索(PHE),即一种通过对随机扰动的奖励进行训练来实现探索的方法。在此过程中,我们简明清晰地解释了随机奖励扰动何时以及为何能产生良好的_bandit算法。我们提出了先前PHE类方法所未包含的数据依赖扰动,使得EVILL在理论与实践中均能匹配Thompson采样式参数扰动方法的性能。此外,我们给出一个广义线性_bandit之外的例子,其中PHE导致不一致估计从而带来线性后悔,而EVILL仍保持良好性能。与PHE类似,EVILL仅需几行代码即可实现。
引用
@article{arxiv.2311.07565,
title = {Exploration via linearly perturbed loss minimisation},
author = {David Janz and Shuai Liu and Alex Ayoub and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2311.07565},
year = {2024}
}