中文

近似缓存:高效服务扩散模型

计算机视觉与模式识别 2023-12-08 v1

摘要

使用扩散模型的文本到图像生成因其能生成符合文本提示的高质量图像而广受欢迎。然而,生产级扩散模型服务是一项资源密集型任务,不仅需要昂贵的高端 GPU,还会产生相当大的延迟。在本文中,我们引入了一种称为近似缓存的技术,该技术可以通过重用先前为相似提示生成图像时创建的中间噪声状态,来减少基于提示的图像生成的迭代去噪步骤。基于这一思想,我们提出了一个端到端的文本到图像系统 Nirvana,该系统使用近似缓存和一种新颖的缓存管理策略——计算收益最低且最常用(LCBFU),在两个真实生产工作负载上平均节省了 % 的 GPU 计算量、19.8% 的端到端延迟和 19% 的美元成本。我们进一步从缓存、流行度和大型生产环境中中间状态复用的角度,对真实生产文本到图像提示进行了广泛的特性描述。

关键词

引用

@article{arxiv.2312.04429,
  title  = {Approximate Caching for Efficiently Serving Diffusion Models},
  author = {Shubham Agarwal and Subrata Mitra and Sarthak Chakraborty and Srikrishna Karanam and Koyel Mukherjee and Shiv Saini},
  journal= {arXiv preprint arXiv:2312.04429},
  year   = {2023}
}

备注

Accepted at NSDI'24