当自适应奖励有害:LLM引导的LEO卫星调度中的因果探针与切换稳定性困境
人工智能
2026-04-07 v1
摘要
针对多波束LEO卫星调度的深度强化学习(DRL)的自适应奖励设计,基于 regime-aware reward weights 应优于静态权重的直觉。我们系统性地测试了这一直觉,发现存在一种切换稳定性困境:接近恒定的奖励权重(342.1 Mbps)优于精心调谐的动态权重(103.3 +/-96.8 Mbps),因为PPO需要准稳态奖励信号以实现价值函数收敛。权重的调整——无论质量如何——都会通过反复重启收敛来降低性能。为了理解具体的权重为何重要,我们引入一种单变量因果探针方法,独立地扰动每个奖励项 +/-20%,并测量PPO在50k步后的响应。探针揭示了反直觉的杠杆作用:切换惩罚项增加20%可为极地交接带来+157 Mbps,为热-冷方案带来+130 Mbps——这些发现对于人类专家或在没有系统性探针的情况下训练的MLP都是无法获取的。我们评估了四种MDP架构变体(固定、规则驱动、学习MLP、微调LLM),在已知和新流量方案上进行测试。MLP在已知方案上实现357.9 Mbps,在新方案上实现325.2 Mbps,而经微调的LLM因权重振荡而崩溃至45.3 +/-43.0 Mbps——输出一致性,而非知识,是唯一的约束因素。我们的发现为通信系统中的LLM-DRL集成提供了以经验为依据的路线图,识别了LLM提供不可替代价值(自然语言意图理解)的地方,而简化方法在其他地方则足矣。
引用
@article{arxiv.2604.03562,
title = {When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling},
author = {Yuanhang Li},
journal= {arXiv preprint arXiv:2604.03562},
year = {2026}
}
备注
8 pages, 3 figures