中文

平滑度自适应上下文_bandit

机器学习 2021-10-19 v5 机器学习

摘要

我们研究一类具有随机协变量的非参数多臂bandit问题,其中关键复杂性驱动因素是收益函数相对于协变量的平滑度。先前的研究集中于在事先已知收益函数平滑度的情况下推导极小极大最优算法。然而在实践中,收益函数的平滑度通常事先未知,而对平滑度的错误设定可能严重恶化现有方法的性能。本工作中,我们考虑平滑度未知的情形,并研究算法何时及如何适应未知平滑度。首先,我们确立:一般而言,设计适应收益函数未知平滑度的算法是不可能的。然而,在自相似条件(其不降低当前动态优化问题的极小极大复杂度)下,我们确立适应未知平滑度是可能的,并进一步设计了一种实现平滑度自适应性能的通用策略。我们的策略在决策过程中推断收益的平滑度,同时利用现成非自适应策略的结构。我们确立:对于具有可微或不可微收益函数的问题设定,该策略匹配(直至对数尺度)在事先已知收益平滑度时可实现的后悔率。

关键词

引用

@article{arxiv.1910.09714,
  title  = {Smoothness-Adaptive Contextual Bandits},
  author = {Yonatan Gur and Ahmadreza Momeni and Stefan Wager},
  journal= {arXiv preprint arXiv:1910.09714},
  year   = {2021}
}