全带宽反馈下非单调随机次模最大化的随机贪婪学习
机器学习
2023-02-03 v1 人工智能
最优化与控制
摘要
我们研究了在无约束组合多臂老虎机中,具有全带宽反馈和随机奖励的次模最大化问题。先前工作在假设奖励函数次模且单调的前提下研究同一问题。本工作中,我们研究更一般的问题,即奖励函数不一定单调,且次模性仅依期望成立。我们提出随机贪婪学习(RGL)算法,并从理论上证明对于时域长度 与臂数 ,其达成 -后悔上界 。我们亦通过实验表明,在次模与非次模设定下,RGL 在经验上均优于其他全带宽变体。
引用
@article{arxiv.2302.01324,
title = {Randomized Greedy Learning for Non-monotone Stochastic Submodular Maximization Under Full-bandit Feedback},
author = {Fares Fourati and Vaneet Aggarwal and Christopher John Quinn and Mohamed-Slim Alouini},
journal= {arXiv preprint arXiv:2302.01324},
year = {2023}
}