中文

超越块-嵌入:文档分块策略的全面分类与评估

信息检索 2026-02-20 v1

摘要

文档分块是稠密检索系统中的关键预处理步骤,但分块策略的设计空间仍鲜有了解。近期研究提出了多种并行方法,包括LLM引导的方法(如DenseX和LumberChunker)和上下文化策略(如Late Chunking),这些方法在分段之前生成嵌入以保留上下文信息。然而,这些方法是独立提出的,且在基准测试上评估时重叠最小,使直接比较困难。本文再现了先前的分块研究,并提出了一个系统框架,将现有策略沿两个关键维度统一:(1)分段方法,包括基于结构的方法(固定大小、句子基于和段落基于),以及基于语义的和LLM引导的方法;(2)嵌入范式,决定分块相对于嵌入的时序(嵌入前分块 vs. 上下文化分块)。我们的再现评估了这些方法在两种不同的检索设置中的表现:文档内检索(针对needle-in-a-haystack)和文档间检索(标准信息检索任务)。我们的全面评估表明,最佳分块策略是任务依赖的:对于文档间检索,简单基于结构的方法优于LLM引导的方法;而对于文档内检索,LumberChunker表现最佳。上下文化分块改善了文档间检索效果,但降低了文档内检索效果。我们还发现,块大小与文档内效果中等相关,但与文档间效果弱相关,这表明分段方法的差异并非仅由块大小驱动。我们的代码和评估基准已公开于(Anonymoused)。

关键词

引用

@article{arxiv.2602.16974,
  title  = {Beyond Chunk-Then-Embed: A Comprehensive Taxonomy and Evaluation of Document Chunking Strategies for Information Retrieval},
  author = {Yongjie Zhou and Shuai Wang and Bevan Koopman and Guido Zuccon},
  journal= {arXiv preprint arXiv:2602.16974},
  year   = {2026}
}

备注

Github link will be pushed later as it's anonymoused at the moment