Crayon:通过即时适配器混合与边缘-服务器混合推理实现定制化设备端大语言模型
计算与语言
2024-06-12 v1
摘要
针对用户指定任务定制大语言模型(LLM)变得日益重要。然而,在云服务器上维护所有定制化的LLM会带来大量的内存和计算开销,并且上传用户数据也可能导致隐私问题。设备端LLM通过缓解这些问题提供了一种有前景的解决方案。然而,设备端LLM的性能固有地受到小规模模型限制的约束。为了克服这些限制,我们首先提出了Crayon,一种用于设备端LLM定制化的新颖方法。Crayon首先构建一个多样化的基础适配器池,然后我们即时将它们混合成一个定制化的适配器,无需额外训练。此外,我们开发了一种设备-服务器混合推理策略,该策略巧妙地将要求更高的查询或非定制化任务分配给服务器上更大、能力更强的LLM。这确保了在不牺牲设备端定制化优势的情况下实现最佳性能。我们精心从多个问答数据集中构建了一个新颖的基准测试,并展示了我们的方法在LLM定制化中的有效性。
引用
@article{arxiv.2406.07007,
title = {Crayon: Customized On-Device LLM via Instant Adapter Blending and Edge-Server Hybrid Inference},
author = {Jihwan Bang and Juntae Lee and Kyuhong Shim and Seunghan Yang and Simyung Chang},
journal= {arXiv preprint arXiv:2406.07007},
year = {2024}
}
备注
ACL 2024 Main