中文

受预算约束的局部语言模型与云端卸载决策的联合持续学习

机器学习 2026-02-06 v2 人工智能

摘要

在严格的内存和计算限制下部署的小型语言模型(SLM)必须持续支持多样化任务,这使得依赖云端大型语言模型(LLM)不可避免。在持续学习期间调控云端协助具有挑战性,因为受奖励驱动的强化学习往往会导致卸载行为不稳定,并在任务分布变化时加剧灾难性遗忘。我们提出 DA-GRPO,这是一种基于 Group Relative Policy Optimization 的双优势扩展, 将云端使用约束直接纳入优势计算中,避免固定奖励塑形和外部路由模型。这种设计使本地模型能够联合学习任务能力和协作行为,使云端请求在 post-training 期间自然出现,同时遵守既定的协助预算。在数学推理和代码生成基准测试上进行的实验表明,DA-GRPO 在切换后提高了准确率,显著降低了遗忘,同时保持稳定的云端使用情况,与先前的协作式和基于路由的方法相比表现更佳。

关键词

引用

@article{arxiv.2602.00166,
  title  = {Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints},
  author = {Evan Chen and Wenzhi Fang and Shiqiang Wang and Christopher Brinton},
  journal= {arXiv preprint arXiv:2602.00166},
  year   = {2026}
}