中文

评估油气企业文档中检索增强生成的分块策略

信息检索 2026-03-26 v1 人工智能

摘要

检索增强生成 (RAG) 已成为一种解决大型语言模型 (LLM) 约束的框架。然而,其有效性根本取决于文档分块——这往往被忽视的因素决定了其质量。本文提出了一项实证研究,对比评估了四种分块策略:固定大小滑动窗口、递归、断点基语义和结构感知。我们使用专有的油气企业文档语料库进行评估,包括文本密集型手册、表格密集型规格说明书以及管道和仪表图 (P&IDs)。我们的发现表明,结构感知分块在整体检索有效性方面表现更好,尤其在前K指标方面,还比语义或基线策略在计算成本方面显著更低。关键的是,所有四种方法在P&IDs 上都表现有限,这凸显了纯文本RAG 在视觉和空间编码文档中的核心局限性。我们得出结论,虽然保持结构显式性对特定领域至关重要,但未来的工作必须集成多模态模型来克服当前局限性。

关键词

引用

@article{arxiv.2603.24556,
  title  = {Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documents},
  author = {Samuel Taiwo and Mohd Amaluddin Yusoff},
  journal= {arXiv preprint arXiv:2603.24556},
  year   = {2026}
}

备注

Presented at CCSEIT 2026. This version matches the published proceedings