中文

基于后决策状态的面向时延能耗的无线系统流量分配在线学习

介观与纳米尺度物理 2026-01-07 v1 材料科学

摘要

我们发展了一种结构感知的强化学习(RL)方法,用于5G用户平面功能(UPFs)中的时延和能耗感知流量分配。我们考虑一个动态系统,其中包含K个容量各异的异构UPFs,处理来自M种不同速率要求的流量的随机到达。我们将该系统建模为马尔可夫决策过程(MDP),以捕捉流量到达和离开(可能未知)以及流量分配对系统的影响。为解决此问题,我们提出一种基于后决策状态(PDS)的值迭代算法,该算法利用MDP的底层结构。通过将受行动控制的动力学与外生因素分离,PDS实现了更快的收敛和高效的自适应流量分配,即使没有关于外生变量的统计知识亦可。仿真结果表明,所提方法的收敛速度更快,长期成本更低于标准Q学习,凸显了PDS基RL在无线网络资源分配中的有效性。

关键词

引用

@article{arxiv.2601.03106,
  title  = {Thermal conductance across bonded SiOx-SiOx interfaces in hybrid bonding process},
  author = {Xingqiang Zhang and Liu Chang and Liyi Li and Zhe Cheng},
  journal= {arXiv preprint arXiv:2601.03106},
  year   = {2026}
}