无线传感网络的跨域终身强化学习
信号处理
2025-08-26 v1
摘要
具有能量收集(EH)功能的无线传感网络(WSNs)预计在智能 6G 系统中发挥关键作用,尤其是在工业感知和控制领域,其中持续运行和可持续能源使用至关重要。鉴于能源资源有限,WSNs 必须高效运行以确保长期性能。然而,其部署受到动态环境的挑战,该环境中 EH 条件、网络规模和流量率随时间变化。在本工作中,我们解决了导致不同学习任务的系统动态问题,其中决策变量保持不变但策略不同,以及导致不同学习域的问题,其中决策空间和策略都随时间演化。为处理此类情形,我们提出了一种用于能源高效 WSN 设计的跨域终身强化学习(CD-L2RL)框架。我们的 CD-L2RL 算法利用先前经验加速跨任务和跨域的适应。不同于基于马尔可夫决策过程或 Lyapunov 优化的常规方法后者假设相对稳定的环境,我们的解决方案通过复用过去任务和域的知识实现快速策略适应,确保连续运行。我们通过多样化条件下的大量仿真进行了验证。结果表明,我们的方法在标准强化学习和基于 Lyapunov 的优化之上分别提高了最多 35% 和 70% 的适应速度,同时也增加了总能量收集量。这些发现凸显了 CD-L2RL 在动态 6G WSNs 中部署的巨大潜力。
引用
@article{arxiv.2508.17852,
title = {Cross-Domain Lifelong Reinforcement Learning for Wireless Sensor Networks},
author = {Hossein Mohammadi Firouzjaei and Rafaela Scaciota and Sumudu Samarakoon and Beatriz Lorenzo},
journal= {arXiv preprint arXiv:2508.17852},
year = {2025}
}