中文

在随机线性_bandit中免费利用初始提示

机器学习 2022-03-09 v1 数据结构与算法

摘要

我们研究了在提供最优动作初始提示形式额外先验知识的情况下,利用bandit反馈进行优化的设定。我们提出了一种用于随机线性bandit的新算法,该算法利用此提示在提示准确时将后悔(regret)改善至O~(T)\tilde O(\sqrt{T}),同时在独立于提示质量的情况下保持极小极大最优的O~(dT)\tilde O(d\sqrt{T})后悔。此外,我们提供了最佳情形与最差情形后悔之间紧权衡的帕累托边界,并给出了匹配的下界。或许令人惊讶的是,我们的工作表明,利用提示可带来可证明的收益而不牺牲最差情形性能,这意味着我们的算法免费自适应于提示的质量。我们还提供了算法对mm个初始提示情形的扩展,表明我们可实现O~(m2/3T)\tilde O(m^{2/3}\sqrt{T})的后悔。

关键词

引用

@article{arxiv.2203.04274,
  title  = {Leveraging Initial Hints for Free in Stochastic Linear Bandits},
  author = {Ashok Cutkosky and Chris Dann and Abhimanyu Das and Qiuyi and Zhang},
  journal= {arXiv preprint arXiv:2203.04274},
  year   = {2022}
}

备注

ALT 2022