中文

Merlin:用于大语言模型推理中无损上下文优化的确定性字节精确去重

计算与语言 2026-05-12 v1

摘要

从大规模检索系统到高级数据管道,数据密集型应用日益受到高度冗余文本语料处理的瓶颈制约。我们提出了 Merlin,一个本地优先、无关平台、高吞吐量的去重与上下文优化引擎,旨在缓解这些低效问题。利用高度优化的、SIMD 友好的开放寻址扁平哈希集结合 xxHash3-64,Merlin 对文本段落和数据块进行快速、字节精确的去重。尽管广泛适用于任何文本处理工作流,其影响在大型语言模型(LLM)生态系统中尤为显著,例如检索增强生成(RAG)。我们的实证评估表明,在低冗余数据集中输入量减少 13.9%,在高冗余管道中减少超过 71%,同时保持绝对的数据保真度。此外,我们详细介绍了该系统通过模型上下文协议(MCP)的集成架构,实现了跨主流 IDE 和自主智能体的安全、零网络拦截部署。本文概述了核心算法设计、性能基准以及在高达 8.7 GB/s 的持续速度下处理数据所需的架构原则。

关键词

引用

@article{arxiv.2605.09990,
  title  = {Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference},
  author = {Sietse Schelpe},
  journal= {arXiv preprint arXiv:2605.09990},
  year   = {2026}
}

备注

Preprint. Implementation and open-source community version available at: https://github.com/corbenicai/merlin-community - https://doi.org/10.5281/zenodo.20090991