无重要性权重的重要性加权:一种用于组合 semi-bandit 的高效算法
机器学习
2016-09-02 v2 机器学习
摘要
我们提出了一种样本高效的重要性加权替代方案,适用于仅能采样访问生成观测的概率分布的情形。我们的新方法称为几何重采样(Geometric Resampling, GR),在 semi-bandit 反馈下的在线组合优化背景下被描述和分析,其中学习器从组合决策集中顺序选择动作以最小化其累积损失。特别地,我们展示了著名的跟随扰动领导者(Follow-the-Perturbed-Leader, FPL)预测方法与几何重采样相结合,产生了该设定下从离线到在线优化的首个计算高效归约。我们对所得算法提供了详尽的理论分析,表明其性能与先前低效的解决方案相当。我们的主要贡献是表明,尽管 GR 过程引发了相对较大的方差,我们的性能保证以高概率成立而非仅期望成立。作为一个附带结果,我们还改进了全反馈在线组合优化中 FPL 的最佳已知后悔界,缩小了该设定下 FPL 与指数权重之间感知到的性能差距。
引用
@article{arxiv.1503.05087,
title = {Importance weighting without importance weights: An efficient algorithm for combinatorial semi-bandits},
author = {Gergely Neu and Gábor Bartók},
journal= {arXiv preprint arXiv:1503.05087},
year = {2016}
}
备注
To appear in JMLR