面向部分去中心化无线网络优化的多智能体多环境混合 Q 学习
信号处理
2024-12-31 v2 机器学习
摘要
Q 学习是无线网络控制与策略优化的强大工具,但在面对大规模状态空间时存在困难。最近的进展,如多环境混合 Q 学习(MEMQ),通过在多个相关环境(即所谓的数字表亲)中集成多种 Q 学习算法,提升了性能并降低了复杂度。然而,MEMQ 是为集中式单智能体网络设计的,不适用于去中心化或多智能体网络。为应对这一挑战,我们提出了一种新颖的多智能体 MEMQ 算法,适用于具有多个移动发射机(TX)和基站(BS)的部分去中心化无线网络,其中 TX 无法获知彼此的状态和动作。在非协调状态下,TX 独立行动以最小化其个体成本。在协调状态下,TX 采用贝叶斯方法根据局部观测估计联合状态,并与领导 TX 共享有限信息以最小化联合成本。信息共享的成本随 TX 数量线性增长,且与联合状态-动作空间大小无关。所提方案比集中式 MEMQ 快 50%,平均策略误差(APE)仅增加 20%;且比几种先进的去中心化 Q 学习算法快 25%,APE 减少 40%。此外,还证明了该算法的收敛性。
引用
@article{arxiv.2409.16450,
title = {A Multi-Agent Multi-Environment Mixed Q-Learning for Partially Decentralized Wireless Network Optimization},
author = {Talha Bozkus and Urbashi Mitra},
journal= {arXiv preprint arXiv:2409.16450},
year = {2024}
}
备注
Accepted to 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)