面向生成式推荐模型的层次化缓存高效服务系统 MTServe
机器学习
2026-04-28 v1 人工智能
摘要
生成式推荐 (Generative Recommendation, GR) 具备优越建模能力,但因反复编码长用户历史记录导致推理成本高昂。虽然跨请求 Key-Value (KV) 缓存复用 presents 显著优化机会,但单个用户状态的规模远超物理 GPU 限制,导致存储爆炸。我们提出 MTServe,一种层次化缓存管理系统,通过将主机 RAM 作为可扩展备份存储来虚拟化 GPU 内存。为弥合各层级间 I/O 差距,MTServe 引入一系列系统级优化,包括混合存储布局、异步数据传输管道及基于局部性的替换策略。在公共数据集和生产环境数据集上,MTServe 实现最高可达 3.1 倍加速,保持接近完美命中率(>98.5%)。
引用
@article{arxiv.2604.22881,
title = {MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches},
author = {Xin Wang and Chi Ma and Shaobin Chen and Pu Wang and Menglei Zhou and Junyi Qiu and Qiaorui Chen and Jiayu Sun and Shijie Liu and Zehuan Wang and Lei Yu and Chuan Liu and Fei Jiang and Wei Lin and Hao Wang and Jiawei Jiang and Xiao Yan},
journal= {arXiv preprint arXiv:2604.22881},
year = {2026}
}