基于生成式扩散模型的深度强化学习训练效率提升:资源分配中的关键作用
机器学习
2025-02-12 v1
摘要
动态的无线网络资源分配涉及复杂且随时间变化的优化问题,推动了深度强化学习(DRL)的采用。然而,大多数现有工作依赖预训练策略,忽略了快速使策略失效的动态环境变化。定期重新训练虽不可避免,但在资源受限的无线系统中会导致巨大的计算成本和能源消耗。我们识别了三大低效再训练的根本原因:高维状态空间、次优的动作空间探索-开发权衡以及奖励设计限制。为克服这些限制,我们提出了基于生成式扩散模型的深度强化学习(D2RL),该方法利用生成式扩散模型(GDMs)全面提升DRL的三个组成部分。GDM的迭代细化过程和分布建模使我们能够:(1)生成多样化的状态样本以改善环境理解,(2)实现动作空间的平衡探索以跳出局部最优,(3)设计更具辨识力的奖励函数以更好地评估动作质量。我们的框架 operates in two modes:模式I利用GDM探索奖励空间并设计严格评估动作质量的判别性奖励函数,而模式II合成多样化的状态样本以增强环境理解和泛化。广泛的实验表明,D2RL在无线通信资源分配中实现更快的收敛和更低的计算成本,同时保持竞争力的策略性能。这项工作凸显了GDM在克服无线网络DRL训练瓶颈中的变革性潜力,为实际的实时部署铺平了道路。
引用
@article{arxiv.2502.07211,
title = {Improve the Training Efficiency of DRL for Wireless Communication Resource Allocation: The Role of Generative Diffusion Models},
author = {Xinren Zhang and Jiadong Yu},
journal= {arXiv preprint arXiv:2502.07211},
year = {2025}
}