基于奖励-free自微调智能体的自适应RAN切片控制
人工智能
2026-03-12 v1 网络与互联网体系结构
摘要
将生成式AI模型集成到AI原生网络系统中为实现自主和自适应控制提供了变革性路径,但其在连续控制任务中的应用受限于内在架构限制,包括有限上下文窗口、缺乏显式奖励信号以及长时序上下文的退化。本文认为,实现稳健连续控制的关键在于通过将经验蒸馏到参数中来内化经验,而非依赖基于提示的记忆。为此,我们提出了一种新颖的自微调框架,使智能体系统能够通过直接与环境交互进行持续学习,无需手工设计奖励。我们的框架实现了双视角反思机制,生成自主语言性反馈,以构建来自交互历史的偏好数据集。随后进行基于偏好的微调将长期经验蒸馈到模型参数中。在动态射频接入网络(RAN)切片任务上进行评估,该任务是需要解决在网络条件波动下在频谱效率、服务质量和重新配置稳定性之间解决严重权衡的挑战性多目标控制问题。实验结果表明,我们的方法在样本效率、稳定性和多指标优化方面超越了标准强化学习基线和现有基于大语言模型的智能体。这些发现表明了自改进生成式智能体用于连续控制任务的潜力,为未来AI原生网络基础设施铺平了道路。
引用
@article{arxiv.2603.10564,
title = {Adaptive RAN Slicing Control via Reward-Free Self-Finetuning Agents},
author = {Yuanhao Li and Haozhe Wang and Geyong Min and Nektarios Georgalas and Wang Miao},
journal= {arXiv preprint arXiv:2603.10564},
year = {2026}
}