中文

基于干扰图的马尔可夫ian无约束多臂赫尔姆顿Bandit分布式学习

机器学习 2025-12-22 v1

摘要

我们研究了在由干扰图建模的通信受限无线网络中,多个认知通信实体(如小区、子网络或认知无线电用户,统称为小区)之间进行的频谱访问和共享的分布式学习问题。我们的目标是实现全局稳定且干扰感知的信道分配。通过一种广义的 Gale-Shapley 多对一匹配来定义稳定性,这是无线资源分配中一个既定的解决方案概念。我们考虑的无线网络中,L 个小区共享 S 个正交信道且不能与其邻居同时使用相同的信道。每个信道都演化为一个带有小区相关奖励的未知无约束马尔可夫过程,这是首个在随机、时变的无约束环境中实现全局Gale-Shapley稳定信道分配的工作。为此,我们开发了 SMILE(Stable Multi-matching with Interference-aware LEarning),一种通信高效的分布式学习算法,将无约束多臂赫尔姆顿学习与图约束协调相结合。SMILE 使小区能够分布式地在未知信道的探索与所学信息的利用之间进行平衡。我们证明了 SMILE 收敛于最优稳定分配,并相对于拥有预期效用完全知识的仕爵人实现 Logarithmic regret。仿真结果验证了理论保证,展示了 SMILE 在多样化频谱共享场景中的鲁棒性、可扩展性和效率。

关键词

引用

@article{arxiv.2512.17161,
  title  = {Distributed Learning in Markovian Restless Bandits over Interference Graphs for Stable Spectrum Sharing},
  author = {Liad Lea Didi and Kobi Cohen},
  journal= {arXiv preprint arXiv:2512.17161},
  year   = {2025}
}

备注

13 pages, 10 figures