中文

横向连接 OLAP 与 RAG:面向语料分区的多维方法设计

信息检索 2026-01-08 v1 人工智能

摘要

检索增强生成(RAG)系统正在大规模文档集合上部署,通常包含数百万文档和数千万文本块。在工业级检索平台上,通常通过水平分片结合近似最近邻搜索、混合索引和优化后的元数据过滤来解决可扩展性问题。虽然这些机制从效率角度有效,但依赖于自下而上的、基于相似性的组织方式,缺乏对语料分区的概念性依据。本文我们主张,大规模 RAG 系统的设计可能受益于两种正交策略的结合:语义聚类优化嵌入空间中的局部性,以及基于概念维度(如时间和组织背景)的多维分区决定检索位置。虽然这些维度已在当前系统中隐式存在,但以一种非结构化且适应性强的方式使用。我们提出“维度事实模型”(Dimensional Fact Model, DFM)作为引导大规模 RAG 语料多维分区设计的概念框架。DFM 提供了一种原则化的方法,用于推理检索场景中的事实、维度、层次结构和粒度。该框架自然支持分层路由和受控后备策略,确保即使在元数据不完整的情况下检索仍保持稳健,同时将搜索过程从“黑箱”相似性匹配转化为可治理且确定性的工作流程。本工作旨作为一篇立场论文;其目标是搭建 OLAP 风格多维建模与现代 RAG 架构之间的鸿沟, stimulate further research on principled, explainable, and governable retrieval strategies at scale.(我们进一步鼓励在大规模情境下进行原则化、可解释且可治理的检索策略的进一步研究。)

关键词

引用

@article{arxiv.2601.03748,
  title  = {Bridging OLAP and RAG: A Multidimensional Approach to the Design of Corpus Partitioning},
  author = {Dario Maio and Stefano Rizzi},
  journal= {arXiv preprint arXiv:2601.03748},
  year   = {2026}
}