中文

面向协作推理的设备-云 LLM 统一方法:本地路由与后训练

机器学习 2026-05-26 v4

摘要

设备-云协作为部署大语言模型 (LLM) 提供了前景,利用轻量级设备模型实现效率,同时依赖强大的云模型进行卓越推理。此设置下的核心挑战之一是为每个输入查询决定其应在本地处理还是卸载到云端。现有方法通常依赖外部路由器,尤其在涉及复杂推理的任务中,往往难以从提示本身准确判断难度。为此,我们提出使设备 LLM 在推理时自行决定是否调用云端协助的能力,并通过基于强化学习的后训练将此能力内化。将设备 LLM 后训练视为奖励最大化问题,我们设计分层奖励以鼓励本地问题解决和明智的云端卸载。为解决所得问题,我们发展出一种具有组级政策梯度以稳定优化,并结合自适应提示过滤以提供补充学习信号以缓解政策崩溃(即专注于本地执行或专注于云端卸载)的算法。广泛的在设备规模 LLaMA 和 Qwen 模型上进行实验,跨越多个推理基准,表明我们的方法 consistently 优于基线方法,显著缩小了与完整云端 LLM 的差距。

关键词

引用

@article{arxiv.2509.24050,
  title  = {Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training},
  author = {Wenzhi Fang and Dong-Jun Han and Liangqi Yuan and Evan Chen and Christopher Brinton},
  journal= {arXiv preprint arXiv:2509.24050},
  year   = {2026}
}

备注

We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies