SCALM:面向基于大型语言模型的自动化聊天服务的语义缓存
计算与语言
2024-06-04 v1 人工智能
摘要
大型语言模型(LLM)已变得越来越流行,正在改变各个领域的广泛应用。然而,其查询缓存系统在现实世界中的有效性尚未得到彻底研究。在这项工作中,我们首次对真实世界的人与LLM交互数据进行了分析,识别出现有基于LLM的聊天服务缓存解决方案中的关键挑战。我们的研究结果表明,当前的缓存方法未能利用语义联系,导致缓存性能低下和额外的令牌成本。为了解决这些问题,我们提出了SCALM,一种新的缓存架构,它强调语义分析并识别重要的缓存条目和模式。我们还详细描述了相应缓存存储和驱逐策略的实现。我们的评估表明,SCALM提高了LLMChat服务的缓存命中率并降低了运营成本。与GPTCache中的其他最先进解决方案相比,SCALM平均相对提高了63%的缓存命中率,并相对节省了77%的令牌。
引用
@article{arxiv.2406.00025,
title = {SCALM: Towards Semantic Caching for Automated Chat Services with Large Language Models},
author = {Jiaxing Li and Chi Xu and Feng Wang and Isaac M von Riedemann and Cong Zhang and Jiangchuan Liu},
journal= {arXiv preprint arXiv:2406.00025},
year = {2024}
}