中文

全带宽反馈下非单调随机次模最大化的随机贪婪学习

机器学习 2023-02-03 v1 人工智能 最优化与控制

摘要

我们研究了在无约束组合多臂老虎机中,具有全带宽反馈和随机奖励的次模最大化问题。先前工作在假设奖励函数次模且单调的前提下研究同一问题。本工作中,我们研究更一般的问题,即奖励函数不一定单调,且次模性仅依期望成立。我们提出随机贪婪学习(RGL)算法,并从理论上证明对于时域长度 TT 与臂数 nn,其达成 12\frac{1}{2}-后悔上界 O~(nT23)\tilde{\mathcal{O}}(n T^{\frac{2}{3}})。我们亦通过实验表明,在次模与非次模设定下,RGL 在经验上均优于其他全带宽变体。

关键词

引用

@article{arxiv.2302.01324,
  title  = {Randomized Greedy Learning for Non-monotone Stochastic Submodular Maximization Under Full-bandit Feedback},
  author = {Fares Fourati and Vaneet Aggarwal and Christopher John Quinn and Mohamed-Slim Alouini},
  journal= {arXiv preprint arXiv:2302.01324},
  year   = {2023}
}