中文

基于李雅普诺夫的带盗贼反馈约束优化方法

机器学习 2022-01-25 v3 最优化与控制 机器学习

摘要

在包括在线广告、合同招聘和无线调度在内的广泛应用中,控制器受到可用资源严格预算约束的限制,每项行动随机消耗资源,且随机可行性约束可能对决策施加重要运行限制。本文中,我们考虑一个通用模型来解决此类问题:每项行动从未知联合分布返回随机奖励、成本和惩罚,决策者在总成本预算约束BB与时刻平均惩罚的随机约束下最大化总奖励。我们提出一种基于李雅普诺夫优化方法的新颖低复杂度算法,名为LyOn{\tt LyOn},并证明对于KK个臂,当BB足够大时其达到O(KBlogB)O(\sqrt{K B\log B})后悔值且零约束违反。LyOn{\tt LyOn}的低计算成本与尖锐性能界表明,基于李雅普诺夫的算法设计方法可有效求解约束盗贼优化问题。

关键词

引用

@article{arxiv.2106.05165,
  title  = {A Lyapunov-Based Methodology for Constrained Optimization with Bandit Feedback},
  author = {Semih Cayci and Yilin Zheng and Atilla Eryilmaz},
  journal= {arXiv preprint arXiv:2106.05165},
  year   = {2022}
}