中文

自信或寻求更强:探索基于不确定性的端侧 LLM 路由——从基准测试到泛化

计算与语言 2025-02-10 v1 人工智能 机器学习

摘要

大语言模型 (LLMs) 越来越多地被部署并普及于边缘设备上。为了提高端侧部署的效率,通常采用小语言模型 (SLMs),因为它们具有高效的解码延迟和更低的能耗。然而,这些 SLMs 在处理复杂查询时通常生成不准确的响应。一种有前景的解决方案是基于不确定性的 SLM 路由,即在 SLM 上产生低置信度响应时,将高风险查询卸载给更强大的 LLMs。这遵循了“如果缺乏信心,就寻求更强支持”的原则以增强可靠性。依赖更强大的 LLMs 虽然有效,但会增加调用成本。因此,在效率和有效性之间取得路由平衡仍然是一个关键挑战。此外,将路由策略高效地泛化到新数据集方面仍然探索不足。在本文中,我们在 1500 多种设置下全面研究了从 SLMs 到 LLMs 的不确定性驱动路由策略的基准测试和泛化。我们的发现表明:首先,不同不确定性量化 (UQ) 方法中的不确定性-正确性对齐显著影响路由性能。其次,不确定性分布更多依赖于特定的 SLM 和所选的 UQ 方法,而非下游数据。基于这一洞察,我们提出了一种校准数据构建指令流程,并开源了一个构建的留出集,以增强在新下游场景中的路由泛化能力。实验结果表明,校准数据在无需任何新数据的情况下即可有效自举路由性能。

关键词

引用

@article{arxiv.2502.04428,
  title  = {Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization},
  author = {Yu-Neng Chuang and Leisheng Yu and Guanchu Wang and Lizhe Zhang and Zirui Liu and Xuanting Cai and Yang Sui and Vladimir Braverman and Xia Hu},
  journal= {arXiv preprint arXiv:2502.04428},
  year   = {2025}
}