中文

向量嵌入中的 4bit 量化用于 RAG

机器学习 2025-01-22 v1 人工智能

摘要

检索增强生成 (RAG) 是一种有前景的技术, 已显示出在缓解大语言模型 (LLM) 的一些局限性方面具有潜力。LLM 有两个主要局限性: 它们可能因训练数据而陈旧, 并且可能生成事实不准确的响应, 即所谓的幻觉现象。RAG 通过利用存储在高维空间中的相关文档嵌入向量的数据库来缓解这些问题。然而, 使用高维嵌入的一个挑战是它们需要大量内存存储。这在处理大规模文档数据库时是一个主要问题。为缓解此问题, 我们提出使用 4bit 量化来存储嵌入向量。这涉及将向量的精度从 32 位浮点数减少到 4 位整数, 可显著降低内存需求。我们的做法具有多个好处。首先, 它显著降低了高维向量数据库的内存存储要求, 使其在资源受限环境中部署 RAG 系统更加可行。其次, 它加快了搜索过程, 因为向量的降低精度允许更快的计算。我们的代码可在 https://github.com/taeheej/4bit-Quantization-in-Vector-Embedding-for-RAG 获取。

关键词

引用

@article{arxiv.2501.10534,
  title  = {4bit-Quantization in Vector-Embedding for RAG},
  author = {Taehee Jeong},
  journal= {arXiv preprint arXiv:2501.10534},
  year   = {2025}
}