缓存与蒸馏:优化对大语言模型的 API 调用
计算与语言
2025-04-28 v1 机器学习
摘要
生成式 AI 工具的大规模部署通常依赖于对大语言模型(LLM)的昂贵 API 调用来满足用户查询。为减少此类调用的频率,可采用一个较小的语言模型——即学生模型——持续在 LLM 的回复上训练。该学生模型逐渐掌握独立处理越来越多用户请求的能力,我们将此过程称为神经缓存。神经缓存的关键在于一个策略,用以决定哪些请求由学生模型单独处理,哪些应重定向至 LLM,并进而辅助学生学习。在本研究中,我们聚焦于分类任务,并考虑一系列基于经典主动学习的选取准则作为该策略。我们的实验表明,边际采样(Margin Sampling)与委员会查询(Query by Committee)在各类任务与预算下均带来稳定收益。
引用
@article{arxiv.2310.13561,
title = {Cache & Distil: Optimising API Calls to Large Language Models},
author = {Guillem Ramírez and Matthias Lindemann and Alexandra Birch and Ivan Titov},
journal= {arXiv preprint arXiv:2310.13561},
year = {2025}
}