中文

ODIA:用于 LLM 基于函数调用内联加速的有向蒸馏

机器学习 2025-07-15 v1 人工智能

摘要

函数调用是一种关键技术,使大语言模型(LLM)能够通过 API 与外部系统交互。然而,LLM 基于函数调用的高延迟显著影响用户体验。本文提出了一种新方法,称为有向蒸馏用于内联加速(ODIA),该方法利用在线用户交互数据加速函数调用。通过自动从生产流量中识别“简单查询”并从较大的模型蒸馏知识到较小的模型,我们的方法在保持准确性的同时,将响应延迟降低 45%(预期)和 78%(中位数)。我们通过在音乐应用程序中的实际部署 demonstrate 了该方法的有效性,其中较小的模型在保持可忽略的准确性损失的同时成功处理了 60% 的流量。该方法需要最小的人工干预,并且通过自动数据收集和模型更新持续改进,因而是生产环境中实用的解决方案。

关键词

引用

@article{arxiv.2507.08877,
  title  = {ODIA: Oriented Distillation for Inline Acceleration of LLM-based Function Calling},
  author = {Hanlong Zhang and Jingsheng Yang and Hao Li and Yuhao He and Franck Gong},
  journal= {arXiv preprint arXiv:2507.08877},
  year   = {2025}
}