中文

能量收集通信中功率分配的在线学习方案

机器学习 2016-08-29 v2

摘要

我们考虑能量收集通信系统中未知分布的时变信道上的功率分配问题。该问题中,发射机必须根据其电池中存储的能量量选择发射功率,以最大化随时间获得的平均速率。我们将此问题建模为马尔可夫决策过程(MDP),以发射机为智能体、电池状态为状态、发射功率为动作、所获速率为奖励。该MDP上的平均奖励最大化问题可通过线性规划(LP)求解,该规划利用状态-动作对的转移概率及其奖励值来选择功率分配策略。由于与状态-动作对相关的奖励未知,我们提出两种在线学习算法:UCLP和Epoch-UCLP,它们学习这些奖励并沿途调整策略。UCLP算法在每一步求解LP,利用奖励的上置信界决定其当前策略,而Epoch-UCLP算法将时间划分为多个时段,仅在时段开始时求解LP,并在该时段内遵循所得策略。我们证明这两种算法产生的奖励损失或后悔(regret)均由常数上界限制。Epoch-UCLP相比UCLP产生更高的后悔,但大幅降低了计算需求。我们还表明所提算法经微小改动可用于最小化代价问题(如具有功率-延迟权衡的分组调度)的在线学习。

关键词

引用

@article{arxiv.1607.02552,
  title  = {Online Learning Schemes for Power Allocation in Energy Harvesting Communications},
  author = {Pranav Sakulkar and Bhaskar Krishnamachari},
  journal= {arXiv preprint arXiv:1607.02552},
  year   = {2016}
}

备注

This paper is under submission in the IEEE Transaction on Information Theory