中文

非单调子模最大化的在线学习:从全信息到Bandit反馈

机器学习 2022-08-17 v1 最优化与控制

摘要

本文重新研究在下闭凸集上的在线非单调连续 DR-子模最大化问题,该问题在机器学习、经济学和运筹学领域有广泛的实际应用。首先,我们提出 Meta-MFW 算法,以每轮 T3/2T^{3/2} 次随机梯度评估的代价实现了 O(T)O(\sqrt{T})1/e1/e-遗憾。据我们所知,Meta-MFW 是首个在下闭凸集上的在线非单调连续 DR-子模最大化问题中获得 O(T)O(\sqrt{T})1/e1/e-遗憾的算法。此外,与 ODC 算法 \citep{thang2021online} 形成鲜明对比的是,Meta-MFW 依赖于简单的在线线性预言机,无需离散化、提升或舍入操作。考虑到实际限制,我们随后提出 Mono-MFW 算法,将每函数的随机梯度评估从 T3/2T^{3/2} 降至 1,并实现了 O(T4/5)O(T^{4/5})1/e1/e-遗憾界。接下来,我们将 Mono-MFW 扩展至 bandit 设定并提出 Bandit-MFW 算法,其达到 O(T8/9)O(T^{8/9})1/e1/e-遗憾界。据我们所知,Mono-MFW 和 Bandit-MFW 分别是首个探索下闭凸集上在线非单调连续 DR-子模最大化问题的一次性设定与 bandit 设定的亚线性遗憾算法。最后,我们在合成与真实数据集上进行数值实验以验证方法的有效性。

关键词

引用

@article{arxiv.2208.07632,
  title  = {Online Learning for Non-monotone Submodular Maximization: From Full Information to Bandit Feedback},
  author = {Qixin Zhang and Zengde Deng and Zaiyi Chen and Kuangqi Zhou and Haoyuan Hu and Yu Yang},
  journal= {arXiv preprint arXiv:2208.07632},
  year   = {2022}
}

备注

31 pages, 6 figures, 3 tables