在随机线性_bandit中免费利用初始提示
机器学习
2022-03-09 v1 数据结构与算法
摘要
我们研究了在提供最优动作初始提示形式额外先验知识的情况下,利用bandit反馈进行优化的设定。我们提出了一种用于随机线性bandit的新算法,该算法利用此提示在提示准确时将后悔(regret)改善至,同时在独立于提示质量的情况下保持极小极大最优的后悔。此外,我们提供了最佳情形与最差情形后悔之间紧权衡的帕累托边界,并给出了匹配的下界。或许令人惊讶的是,我们的工作表明,利用提示可带来可证明的收益而不牺牲最差情形性能,这意味着我们的算法免费自适应于提示的质量。我们还提供了算法对个初始提示情形的扩展,表明我们可实现的后悔。
引用
@article{arxiv.2203.04274,
title = {Leveraging Initial Hints for Free in Stochastic Linear Bandits},
author = {Ashok Cutkosky and Chris Dann and Abhimanyu Das and Qiuyi and Zhang},
journal= {arXiv preprint arXiv:2203.04274},
year = {2022}
}
备注
ALT 2022