中文

面向联合通信与感知的分段平稳多目标多臂老虎机问题

机器学习 2023-02-14 v2 信号处理

摘要

我们研究动态环境中的多目标多臂老虎机问题。该问题刻画了一个顺序从给定集合中选择臂的决策者。若被选中,每个动作产生一个奖励向量,其中每个元素服从分段平稳伯努利分布。智能体的目标是从帕累托最优臂集合中选取一个臂以最小化其遗憾值。我们提出一种基于帕累托通用上置信界(UCB)且带变化检测的算法来解决该问题。通过发展多维空间的基本不等式,我们证明在断点数 γT\gamma_T 已知时,所提算法保证遗憾界为 γTlog(T/γT)\gamma_T\log(T/{\gamma_T}) 阶。若无此假设,算法的遗憾界为 γTlog(T)\gamma_T\log(T)。最后,我们将集成通信与感知系统中的节能波形设计问题作为一个示例进行表述。在示例及合成与真实世界数据集上的数值实验证明了我们的策略相较于现有方法的效率。

关键词

引用

@article{arxiv.2302.05257,
  title  = {Piecewise-Stationary Multi-Objective Multi-Armed Bandit with Application to Joint Communications and Sensing},
  author = {Amir Rezaei Balef and Setareh Maghsudi},
  journal= {arXiv preprint arXiv:2302.05257},
  year   = {2023}
}