中文

多资源 restless matching bandit 的深度索引策略及其在多信道调度中的应用

机器学习 2024-08-21 v2

摘要

多信道无线通信系统中的调度在有效分配资源方面面临巨大挑战。为应对这些挑战,我们研究了一种多资源 restless matching bandit(MR-RMB)模型,用于异构资源系统,目标是最大化长期折现总奖励同时满足资源约束。我们还将其推广到多信道无线通信之外的应用。我们讨论了 Max-Weight Index Matching 算法,该算法基于学习到的部分索引优化资源分配。我们推导了索引学习的策略梯度定理。我们的主要贡献是引入了一种新的深度索引策略(DIP),一种专为 MR-RMB 设计的在线学习算法。DIP 利用策略梯度定理学习部分索引,适用于具有卷积且未知的转移核的异构资源。我们通过在三个不同的 MR-RMB 问题上评估 DIP 的性能来展示其效用。模拟结果表明 DIP 确实能够高效地学习部分索引。

关键词

引用

@article{arxiv.2408.07205,
  title  = {Deep Index Policy for Multi-Resource Restless Matching Bandit and Its Application in Multi-Channel Scheduling},
  author = {Nida Zamir and I-Hong Hou},
  journal= {arXiv preprint arXiv:2408.07205},
  year   = {2024}
}