约束OCO的周期性更新及其在大规模多天线系统中的应用
信息论
2021-07-13 v2 math.IT
摘要
在许多动态系统中,系统运行决策随时间更新,决策制定者需要一种在线学习方法来优化其策略以应对变化的环境。当损失与约束函数为凸时,这属于在线凸优化(OCO)这一通用范畴。在现有OCO工作中,环境被假设为以时隙方式变化,而决策在每个时隙更新。然而,许多无线通信系统仅允许周期性决策更新,即每个决策在多个时隙内固定,而环境在决策时刻之间变化。标准OCO模型对这些系统并不适用。因此,本文考虑OCO的周期性决策更新。我们的目标是在短期与长期约束下,最小化时变凸损失函数的累积值。当前更新周期内损失函数的信息可能不完整,且仅在决策做出后揭示给决策制定者。我们提出了一种高效算法,称为周期排队与梯度聚合(PQGA),其利用新颖的周期队列与可能的多步聚合梯度下降来随时间更新决策。我们推导了PQGA的动态后悔、静态后悔与约束违反的上界。作为一个应用示例,我们研究了PQGA在由多个无线服务提供商共享的大规模多天线系统中的性能。仿真结果表明,PQGA收敛迅速,并大幅优于已知的最佳替代方案。
引用
@article{arxiv.2103.02124,
title = {Periodic Updates for Constrained OCO with Application to Large-Scale Multi-Antenna Systems},
author = {Juncheng Wang and Min Dong and Ben Liang and Gary Boudreau},
journal= {arXiv preprint arXiv:2103.02124},
year = {2021}
}
备注
37 pages, 6 figures