TweakLLM:用于动态调整缓存响应的路由架构
机器学习
2025-09-11 v2 计算与语言
摘要
大型语言模型(LLM)每日处理数百万查询,高效响应缓存是降低成本和延迟的有力优化手段。然而,由于聊天交互的个人化特性以及语义相似性搜索的有限准确性,保持响应与用户查询的相关性方面存在挑战。为此,我们提出TweakLLM,一种新颖的路由架构,采用轻量级LLM动态适应 incoming 提示中的缓存响应。通过全面评估,包括用户研究中的侧边比较、满意度投票以及多智能体LLM辩论,我们展示TweakLLM在保持与前沿模型相当的响应质量方面显著提升了缓存有效性。我们的结果在真实世界数据集上表明,TweakLLM是一种可扩展且资源高效的高频率LLM部署缓存解决方案,无需牺牲用户体验。
引用
@article{arxiv.2507.23674,
title = {TweakLLM: A Routing Architecture for Dynamic Tailoring of Cached Responses},
author = {Muhammad Taha Cheema and Abeer Aamir and Khawaja Gul Muhammad and Naveed Anwar Bhatti and Ihsan Ayyub Qazi and Zafar Ayyub Qazi},
journal= {arXiv preprint arXiv:2507.23674},
year = {2025}
}
备注
13 pages, 9 figures