中文

基于单点抽样的分布式bandit凸优化与时变约束

系统与控制 2025-04-25 v2 系统与控制 信号处理

摘要

本文考虑分布式bandit凸优化问题,其中的时变约束。该问题中,全局损失函数是所有局部凸损失函数的平均值,这些损失函数事先是未知的。每个代理人依次在可被满足但可被违反的时变不等式约束下作出自身决策。对于均匀联合强连通时变有向图,本文提出了一种基于单点抽样的分布式bandit在线原始分布算法。我们证明,若基准的路径长度以亚线性方式增加,则实现亚线性动态网络累积懊怼和网络累积约束违规。此外,建立了O(T3/4+g)\mathcal{O}({T^{3/4 + g}})静态网络累积懊怼界和O(T1g/2)\mathcal{O}( {{T^{1 - {g}/2}}} )网络累积约束违规界,其中TT为总迭代次数,g(0,1/4)g\in(0,1/4)为权衡参数。此外,针对强凸局部损失函数,建立了较低的静态网络累积懊怼界O(T2/3+4g/3)\mathcal{O}( {{T^{2/3 + 4g /3}}} )。最后,给出一个数值示例来验证理论结果。

关键词

引用

@article{arxiv.2504.16211,
  title  = {One-Point Sampling for Distributed Bandit Convex Optimization with Time-Varying Constraints},
  author = {Kunpeng Zhang and Lei Xu and Xinlei Yi and Guanghui Wen and Lihua Xie and Tianyou Chai and Tao Yang},
  journal= {arXiv preprint arXiv:2504.16211},
  year   = {2025}
}

备注

15 pages, 3 figures