信息年龄多臂老虎机的后悔界
系统与控制
2020-06-23 v2 系统与控制
摘要
我们考虑一个系统,其中单一信源测量/跟踪时变量,并周期性地尝试将这些测量报告给监控站。来自信源的每次更新须调度到 K 条可用通信信道之一上。每次尝试通信的成功概率是所用信道的函数。该函数在调度器处未知。关注的度量为准时信息年龄(Age-of-Information, AoI),正式定义为自目的地接收到信源最近一次更新以来经过的时间。我们将调度问题建模为多臂老虎机问题的一个变体,以通信信道为臂。我们刻画了任意策略可达成的 AoI 后悔下界,并刻画了 UCB、Thompson Sampling 及其变体的性能。我们的分析结果表明,UCB 与 Thompson Sampling 对于 AoI 老虎机是阶最优的。此外,我们提出了新策略,其与 UCB 和 Thompson Sampling 不同,利用当前 AoI 做出调度决策。通过仿真,我们展示了所提出的 AoI 感知策略优于现有的 AoI 无关策略。
引用
@article{arxiv.2001.09317,
title = {Regret of Age-of-Information Bandits},
author = {Santosh Fatale and Kavya Bhandari and Urvidh Narula and Sharayu Moharir and Manjesh Kumar Hanawal},
journal= {arXiv preprint arXiv:2001.09317},
year = {2020}
}
备注
30 pages, 4 figures