非单调子模最大化的在线学习:从全信息到Bandit反馈
机器学习
2022-08-17 v1 最优化与控制
摘要
本文重新研究在下闭凸集上的在线非单调连续 DR-子模最大化问题,该问题在机器学习、经济学和运筹学领域有广泛的实际应用。首先,我们提出 Meta-MFW 算法,以每轮 次随机梯度评估的代价实现了 的 -遗憾。据我们所知,Meta-MFW 是首个在下闭凸集上的在线非单调连续 DR-子模最大化问题中获得 的 -遗憾的算法。此外,与 ODC 算法 \citep{thang2021online} 形成鲜明对比的是,Meta-MFW 依赖于简单的在线线性预言机,无需离散化、提升或舍入操作。考虑到实际限制,我们随后提出 Mono-MFW 算法,将每函数的随机梯度评估从 降至 1,并实现了 的 -遗憾界。接下来,我们将 Mono-MFW 扩展至 bandit 设定并提出 Bandit-MFW 算法,其达到 的 -遗憾界。据我们所知,Mono-MFW 和 Bandit-MFW 分别是首个探索下闭凸集上在线非单调连续 DR-子模最大化问题的一次性设定与 bandit 设定的亚线性遗憾算法。最后,我们在合成与真实数据集上进行数值实验以验证方法的有效性。
引用
@article{arxiv.2208.07632,
title = {Online Learning for Non-monotone Submodular Maximization: From Full Information to Bandit Feedback},
author = {Qixin Zhang and Zengde Deng and Zaiyi Chen and Kuangqi Zhou and Haoyuan Hu and Yu Yang},
journal= {arXiv preprint arXiv:2208.07632},
year = {2022}
}
备注
31 pages, 6 figures, 3 tables