WindVE:面向 CPU-NPU 的协作向量嵌入
分布式、并行与集群计算
2025-06-16 v4
摘要
检索增强生成 (Retrieval-Augmented Generation) 是一种通过集成信息检索来提升大语言模型性能的技术。在产业中,基于大语言模型的推理服务对成本性能比极为敏感,这促使人们需要提高推理服务中硬件资源的利用率。具体而言,向量嵌入和检索过程最多占总时延的 20%。因此,优化向量嵌入中计算资源的利用率对于提高推理过程的成本性能比至关重要,从而提升其产品竞争力。在本文中,我们分析了向量嵌入技术在推理服务中的部署成本,提出了理论公式,并通过数学表达式确定,通过提高处理并发查询能力是降低向量嵌入部署成本的关键。因此,本文聚焦于提高产品处理并发查询能力的能力。为在不牺牲性能的前提下优化并发能力,我们设计了一个队列管理器,能够巧妙地卸载 CPU 峰值查询。该管理器利用线性回归模型确定最佳队列深度,这一参数对系统效能具有重大影响。我们进一步开发了一个名为 WindVE 的系统,其使用 CPU-NPU 混合架构来卸载峰值并发查询,利用两种处理器之间的性能差异来有效管理流量激增。通过实验,我们将 WindVE 与最先进的向量嵌入框架 FlagEmbedding 进行比较,实现的并发水平比无卸载方案高出最高 22.3%。
关键词
引用
@article{arxiv.2504.14941,
title = {WindVE: Collaborative CPU-NPU Vector Embedding},
author = {Jinqi Huang and Xuebing Yu and Yi Xiong and Wenjie Huang and Entong Li and Li Zeng and Xin chen},
journal= {arXiv preprint arXiv:2504.14941},
year = {2025}
}