基于李雅普诺夫的带盗贼反馈约束优化方法
机器学习
2022-01-25 v3 最优化与控制
机器学习
摘要
在包括在线广告、合同招聘和无线调度在内的广泛应用中,控制器受到可用资源严格预算约束的限制,每项行动随机消耗资源,且随机可行性约束可能对决策施加重要运行限制。本文中,我们考虑一个通用模型来解决此类问题:每项行动从未知联合分布返回随机奖励、成本和惩罚,决策者在总成本预算约束与时刻平均惩罚的随机约束下最大化总奖励。我们提出一种基于李雅普诺夫优化方法的新颖低复杂度算法,名为,并证明对于个臂,当足够大时其达到后悔值且零约束违反。的低计算成本与尖锐性能界表明,基于李雅普诺夫的算法设计方法可有效求解约束盗贼优化问题。
引用
@article{arxiv.2106.05165,
title = {A Lyapunov-Based Methodology for Constrained Optimization with Bandit Feedback},
author = {Semih Cayci and Yilin Zheng and Atilla Eryilmaz},
journal= {arXiv preprint arXiv:2106.05165},
year = {2022}
}