中文

UpANNS:利用真实存内计算架构提升十亿级近似最近邻搜索效率

硬件体系结构 2025-08-21 v2

摘要

近似最近邻搜索(ANNS)是现代人工智能系统的关键组成部分,例如推荐引擎和检索增强大语言模型(RAG-LLMs)。然而,将 ANNS 扩展到十亿级数据集会暴露出严重的效率低下问题:基于 CPU 的方案受限于内存带宽瓶颈,而 GPU 实现则未能充分利用硬件资源,导致性能和能耗均不理想。为解决这些挑战,我们提出 UpANNS,一个利用存内计算(PIM)架构加速十亿级 ANNS 的新颖框架。UpANNS 集成了四项关键创新,包括:1) 架构感知的数据放置,通过负载均衡最小化延迟;2) 动态资源管理,实现最优 PIM 利用率;3) 共现优化编码,减少冗余计算;4) 早期剪枝策略,实现高效的 top-k 选择。在商用 UPMEM 硬件上的评估表明,UpANNS 的每秒查询数(QPS)是基于 CPU 的 Faiss 的 4.3 倍,同时性能与 GPU 相当,但能效提高了 2.3 倍。其近线性可扩展性确保了应对不断增长的数据集的实用性,使其成为实时大语言模型服务和大型检索系统等应用的理想选择。

关键词

引用

@article{arxiv.2410.23805,
  title  = {UpANNS: Enhancing Billion-Scale ANNS Efficiency with Real-World PIM Architecture},
  author = {Sitian Chen and Amelie Chi Zhou and Yucheng Shi and Yusen Li and Xin Yao},
  journal= {arXiv preprint arXiv:2410.23805},
  year   = {2025}
}

备注

Accepted by SC 25