中文

结合端侧小模型与远端大语言模型的感知不确定性的混合推理

机器学习 2025-03-19 v3 分布式、并行与集群计算 信息论 网络与互联网体系结构 信号处理 math.IT

摘要

本文研究了一种混合语言模型(HLM)架构,该架构将运行在移动设备上的小语言模型(SLM)与托管在无线网络基站(BS)处的大语言模型(LLM)相集成。HLM 的 token 生成过程遵循投机推理原则:SLM 的词表分布被上传至 LLM,由 LLM 接受或拒绝,被拒绝的 token 由 LLM 重新采样。虽然这种方法确保了 SLM 和 LLM 词表分布之间的一致性,但由于上行传输以及运行两个语言模型的计算成本,其 token 吞吐量较低。为了解决这一问题,我们提出了一种名为感知不确定性的机会主义 HLM(U-HLM)的新型 HLM 结构,其中 SLM 在本地测量其输出不确定性,并对于可能被接受的 token 跳过上行传输和 LLM 操作。这种机会性跳过得益于我们关于 SLM 不确定性与 LLM 拒绝概率之间存在线性相关性的经验发现。我们解析地推导了不确定性阈值并评估了其预期的拒绝风险。仿真表明,U-HLM 将上行传输和 LLM 计算减少了 45.93%,同时实现了高达 97.54% 的 LLM 推理准确率,并且 token 吞吐量比不跳过的 HLM 快 2.54×\times

关键词

引用

@article{arxiv.2412.12687,
  title  = {Uncertainty-Aware Hybrid Inference with On-Device Small and Remote Large Language Models},
  author = {Seungeun Oh and Jinhyuk Kim and Jihong Park and Seung-Woo Ko and Tony Q. S. Quek and Seong-Lyun Kim},
  journal= {arXiv preprint arXiv:2412.12687},
  year   = {2025}
}

备注

7 pages, 6 figures; to be presented at IEEE International Conference on Machine Learning for Communication and Networking (ICMLCN) 2025