中文

分布式赌博机在线凸优化与时变耦合不等式约束

最优化与控制 2019-12-10 v1

摘要

本文考虑分布式赌博机在线凸优化与时变耦合不等式约束问题。该问题可定义为学习者群体与对手之间的重复博弈。学习者试图最小化一系列全局损失函数,同时满足一系列耦合约束函数。全局损失和耦合约束函数分别是局部凸损失和约束函数之和,由对手自适应生成。局部损失和约束函数以赌博机方式揭示,即仅向学习者揭示采样点处的损失和约束函数值,且每个学习者私下持有揭示的函数值。我们考虑两种场景:单点和两点赌博机反馈,并提出两种相应的分布式赌博机在线算法。我们证明,如果比较器序列的累积变化也呈次线性增长,则这两种算法可实现次线性期望遗憾和约束违反。特别地,我们证明在单点赌博机反馈设置下实现 O(Tθ1)\mathcal{O}(T^{\theta_1}) 期望静态遗憾和 O(T7/4θ1)\mathcal{O}(T^{7/4-\theta_1}) 约束违反,在两点赌博机反馈设置下实现 O(Tmax{κ,1κ})\mathcal{O}(T^{\max\{\kappa,1-\kappa\}}) 期望静态遗憾和 O(T1κ/2)\mathcal{O}(T^{1-\kappa/2}) 约束违反,其中 θ1(3/4,5/6]\theta_1\in(3/4,5/6]κ(0,1)\kappa\in(0,1) 是用户定义的权衡参数。最后,通过简单电网示例的数值模拟说明这些理论结果。

关键词

引用

@article{arxiv.1912.03719,
  title  = {Distributed Bandit Online Convex Optimization with Time-Varying Coupled Inequality Constraints},
  author = {Xinlei Yi and Xiuxian Li and Tao Yang and Lihua Xie and Karl H. Johansson and Tianyou Chai},
  journal= {arXiv preprint arXiv:1912.03719},
  year   = {2019}
}