Hera:面向个性化推荐的异构感知多租户推理服务器
分布式、并行与集群计算
2023-02-24 v1 信息检索
机器学习
摘要
尽管提供低延迟是部署推荐服务的基本要求,实现高资源利用率对于具成本效益地维护数据中心也至关重要。共置一个模型的多个工作进程是最大化查询级并行性与服务器吞吐量的有效途径,但共享资源上并发工作进程引起的干扰会妨碍服务器查询满足其SLA。Hera利用多租户推荐模型的异构内存需求,智能确定一组高产出共置模型及其资源分配,在提供快速响应时间的同时实现高吞吐量。我们展示了Hera在有效机器利用率上平均提升37.3%,使所需服务器减少26%,显著优于基线推荐推理服务器。
引用
@article{arxiv.2302.11750,
title = {Hera: A Heterogeneity-Aware Multi-Tenant Inference Server for Personalized Recommendations},
author = {Yujeong Choi and John Kim and Minsoo Rhu},
journal= {arXiv preprint arXiv:2302.11750},
year = {2023}
}