利用OpenVINO协同结合推测采样与KV缓存优化用于生成式AI
机器学习
2024-04-10 v2 人工智能
性能
摘要
推理优化对于改善用户体验以及降低基础设施成本和功耗至关重要。在本文中,我们阐述了一种称为推测采样的动态执行形式,以降低文本生成的整体延迟,并将其与标准自回归采样进行比较。这可与基于模型的优化(例如量化)一同使用,以提供优化方案。两种采样方法均利用KV缓存。我们提供了一个Jupyter notebook以及一些示例执行。
引用
@article{arxiv.2311.04951,
title = {Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO},
author = {Haim Barad and Ekaterina Aidova and Yury Gorbachev},
journal= {arXiv preprint arXiv:2311.04951},
year = {2024}
}
备注
Code available at https://github.com/openvinotoolkit/openvino_notebooks/tree/latest/notebooks/speculative-sampling