线性_bandit中 ε-最优答案识别的答案选择
机器学习
2022-06-10 v1 机器学习
摘要
在纯探索问题中,信息被顺序收集以回答关于随机环境的问题。尽管近年来线性 bandit 的最佳臂识别已被广泛研究,但致力于识别一个与最佳臂 ε-接近(而非恰好最佳)的臂的工作很少。在这个存在多个正确答案的问题中,识别算法应聚焦于这些答案中的一个候选并验证其正确。我们证明,选择均值最高的答案无法使算法在期望样本复杂度方面达到渐近最优。相反,应识别一个“最远答案”。利用该见解仔细选择候选答案,我们开发了一个简单过程,将最佳臂识别算法改造用于解决转导线性随机 bandit 中的 ε-最优答案识别。最后,我们针对该设定提出了一种渐近最优算法,并证明其相对于现有改进的最佳臂识别算法具有竞争力的实证性能。
引用
@article{arxiv.2206.04456,
title = {Choosing Answers in $\varepsilon$-Best-Answer Identification for Linear Bandits},
author = {Marc Jourdan and Rémy Degenne},
journal= {arXiv preprint arXiv:2206.04456},
year = {2022}
}
备注
47 pages, 10 figures, 8 tables. To be published in the 39th International Conference on Machine Learning, Baltimore, Maryland, USA, PMLR 162, 2022