分布式赌博机在线凸优化与时变耦合不等式约束
最优化与控制
2019-12-10 v1
摘要
本文考虑分布式赌博机在线凸优化与时变耦合不等式约束问题。该问题可定义为学习者群体与对手之间的重复博弈。学习者试图最小化一系列全局损失函数,同时满足一系列耦合约束函数。全局损失和耦合约束函数分别是局部凸损失和约束函数之和,由对手自适应生成。局部损失和约束函数以赌博机方式揭示,即仅向学习者揭示采样点处的损失和约束函数值,且每个学习者私下持有揭示的函数值。我们考虑两种场景:单点和两点赌博机反馈,并提出两种相应的分布式赌博机在线算法。我们证明,如果比较器序列的累积变化也呈次线性增长,则这两种算法可实现次线性期望遗憾和约束违反。特别地,我们证明在单点赌博机反馈设置下实现 期望静态遗憾和 约束违反,在两点赌博机反馈设置下实现 期望静态遗憾和 约束违反,其中 和 是用户定义的权衡参数。最后,通过简单电网示例的数值模拟说明这些理论结果。
引用
@article{arxiv.1912.03719,
title = {Distributed Bandit Online Convex Optimization with Time-Varying Coupled Inequality Constraints},
author = {Xinlei Yi and Xiuxian Li and Tao Yang and Lihua Xie and Karl H. Johansson and Tianyou Chai},
journal= {arXiv preprint arXiv:1912.03719},
year = {2019}
}