面向无线接入网络的强化学习实用政策蒸馏
机器学习
2026-01-29 v2
摘要
在无线接入网络(RAN)中采用人工智能(AI)存在诸多挑战,包括链路级测量(如CQI报告)获取受限、实时处理约束严苛(如每TTI sub-1 ms)以及网络异构性(不同频谱带、细胞类型和厂商设备)。一个关键但常被忽视的障碍在于RAN基带硬件的计算和存储限制,尤其是传统4代(4G)系统,通常缺乏专用神经加速器。因此,仅能有效部署轻量级AI模型(<1MB且推理时间<100~μs),限制了其性能和适用范围。然而,实现跨多样网络条件的强大泛化能力往往需要大规模模型,伴随巨大的资源需求。为解决这一权衡,本文聚焦基于强化学习的链路适配任务,探讨政策蒸馏。我们研究两种策略:单政策蒸馏——将场景无关教师模型压缩为一个通用学生模型;多政策蒸馏——将多个场景特定教师整合为单个通用学生模型。在高保真5代(5G)合规模拟器中进行实验评估,结果表明两种策略均产生紧凑学生模型,既保留教师的泛化能力,又符合现有RAN硬件的计算和存储限制。
引用
@article{arxiv.2511.06563,
title = {Practical Policy Distillation for Reinforcement Learning in Radio Access Networks},
author = {Sara Khosravi and Burak Demirel and Linghui Zhou and Javier Rasines and Pablo Soldati},
journal= {arXiv preprint arXiv:2511.06563},
year = {2026}
}
备注
This paper is accepted for publication in IEEE International Symposium on Personal, Indoor and Mobile Radio Communications, 2025