关于 Bandit 线性优化的复杂度
机器学习
2014-08-12 v1
摘要
我们研究了具有 bandit 反馈的在线线性优化问题的可达成 regret,与全信息设定不同,在该设定中玩家只能观察到自身的损失而非完整的损失向量。我们表明,在此设定下 bandit 信息的代价可高达 ,从而驳斥了著名的猜想,即 bandit 线性优化的 regret 至多为全信息 regret 的 倍。令人惊讶的是,这一结果是通过对标准域进行“平凡”修改而证明的,而这些修改在全信息设定中没有任何影响。本文呈现的这一结果及其他结果突显了全信息学习与 bandit 学习之间一些有趣的差异,而这些差异在以往文献中未被考虑。
引用
@article{arxiv.1408.2368,
title = {On the Complexity of Bandit Linear Optimization},
author = {Ohad Shamir},
journal= {arXiv preprint arXiv:1408.2368},
year = {2014}
}