中文

用于无线传感器网络睡眠调度的双时间尺度收敛 Q 学习

系统与控制 2014-03-25 v2 机器学习

摘要

本文研究无线传感器网络 (WSNs) 中的入侵检测应用。我们探讨了如何调度各个传感器的睡眠时间,以在将跟踪误差降至最低的同时最大化网络寿命。我们将此问题建模为具有连续状态 - 动作空间的部分可观测马尔可夫决策过程 (POMDP),其方式类似于 Fuemmeler 和 Veeravalli [2008] 的工作。然而,与他们的公式不同,我们考虑无限时域折扣成本和平均成本目标作为性能准则。针对每种准则,我们提出了一种在双时间尺度上运行的收敛同策略 (on-policy) Q 学习算法,并采用函数近似来处理底层 POMDP 相关的维数灾难。我们提出的算法在较快的时间尺度上结合使用了基于单次模拟同时扰动随机近似 (SPSA) 估计的策略梯度更新,而在较慢的时间尺度上则以类似同策略时序差分 (TD) 算法的方式更新 Q 值参数(源于 Q 值的线性函数近似)。每种算法中采用的特征选择方案以有助于搜索最优睡眠调度策略的方式管理能量和跟踪分量。为了进行比较,我们在折扣和平均设置下也开发了 Q 学习算法的函数近似类比。该算法与双时间尺度变体不同,不具备理论收敛保证。最后,我们还调整了我们的算法,以包含针对入侵者移动模型的随机迭代估计方案。在二维网络设置下的仿真结果表明,与最近的前期工作相比,我们的算法仅以增加少量传感器为代价,实现了更好的跟踪精度。

关键词

引用

@article{arxiv.1312.7292,
  title  = {Two Timescale Convergent Q-learning for Sleep--Scheduling in Wireless Sensor Networks},
  author = {Prashanth L. A. and Abhranil Chatterjee and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:1312.7292},
  year   = {2014}
}