中文

检索增强生成中的字节精确去重:跨公共基准的三区域实证分析

计算与语言 2026-05-12 v1

摘要

本预印本对检索增强生成(RAG)流水线中的字节精确块级去重进行了实证分析。我们在三种不同的操作区域测量上下文缩减:干净学术检索(在 22.2M BeIR 段落上实现 0.16% 字节缩减)、构建的企业模式(24.03% 缩减)和多轮对话 AI(80.34% 缩减)。为了验证质量保持,我们在四个生产 API(Google Gemini 2.5 Flash、Anthropic Claude Sonnet 4.6、Meta Llama 3.3 70B 和 OpenAI GPT-5.1)上进行了跨供应商的 5 评委校准面板评估。对面板多数判定为实质性不同(MAT)的对应用五类人在环去噪协议,我们确认字节精确去重引入了零可测量的质量退化。审计后,所有四个供应商在干净和高冗余 RAG 区域均通过了严格的 <5% Wilson 95% 上界 MAT 阈值。这项工作表明,可以在不损害评估级模型质量的情况下,确定性地实现大量推理计算节省。

关键词

引用

@article{arxiv.2605.09611,
  title  = {Byte-Exact Deduplication in Retrieval-Augmented Generation: A Three-Regime Empirical Analysis Across Public Benchmarks},
  author = {Sietse Schelpe},
  journal= {arXiv preprint arXiv:2605.09611},
  year   = {2026}
}

备注

Preprint. Implementation and open-source community version available at: https://github.com/corbenic/merlin-community - https://zenodo.org/records/20090712