ReaCritic:面向无线网络的基于 Transformer 的强化学习 Critic 模型扩展
机器学习
2026-02-19 v2 网络与互联网体系结构
摘要
异构网络 (HetNets) 因用户需求多样且无线条件时变,构成智能管理的关键挑战。这些因素引入了显著的决策复杂度,限制了现有深度强化学习 (DRL) 方法的适应性。在许多 DRL 算法中,尤其是价值型或演员-评论家结构,评论家组件在通过估计价值函数指导策略学习方面发挥关键作用。然而,传统评论家模型常使用浅层架构,将观察直接映射到标量估计,限制了其处理多任务复杂度的能力。相比之下,最近在大型语言模型 (LLM) 推理扩展方面的进展表明,生成中间推理步骤可显著提高决策质量。受此启发,我们提出 ReaCritic,一种基于 Transformer 的推理式评论家模型扩展方案,将类似推理的能力引入 DRL。ReaCritic 对平行状态-动作输入进行水平推理,通过深层 Transformer 堆叠进行垂直推理。它与广泛的价值型和演员-评论家 DRL 算法兼容,在动态无线环境中增强了泛化能力。大量实验表明,ReaCritic 在各种 HetNet 设置和标准 OpenAI Gym 控制任务中提高了收敛速度和最终性能。ReaCritic 的代码已公开于 https://github.com/NICE-HKU/ReaCritic。
关键词
引用
@article{arxiv.2505.10992,
title = {ReaCritic: Reasoning Transformer-based DRL Critic-model Scaling For Wireless Networks},
author = {Feiran You and Hongyang Du},
journal= {arXiv preprint arXiv:2505.10992},
year = {2026}
}