LSHBloom:内存高效的极端规模文档去重
机器学习
2026-01-28 v4
摘要
当代大型语言模型(LLM)训练管道需要从多种来源(如网络、学术、出版等)汇集充满文本数据的互联网规模数据库。通过去重——检测并消除相同内容的额外实例——是组装和精选LLM训练数据集的重点。不受限制地,训练数据集中的重复内容会增加训练成本,并导致模型记忆或作弊评估等不可取的属性。不幸的是,当前用于文档级去重的方法要么在准确识别重复文档方面不可靠,要么在运行时间和内存方面极其昂贵。我们提出LSHBloom,这是MinhashLSH的一个扩展,用轻量级Bloom过滤器取代昂贵的LSHIndex。LSHBloom在去重性能上达到与MinhashLSH相同的领先水平,仅略增少量的误报(我们实验中接近零),同时在运行时间上具有竞争力(在peS2o上比MinhashLSH快12倍),关键的是使用空间仅为MinhashLSH的1/18(以peS2o为准)。基于外推,我们展示即使在数十亿文档的极端规模下,这种在空间和运行时间上的优势仍然保持。LSHBloom使实践者能够以通常仅可实现的低级方法才能实现的规模,访问MinHashLSH的去重质量。因此,LSHBloom有望推动高质量文档去重扩展到互联网规模的文本数据集。
关键词
引用
@article{arxiv.2411.04257,
title = {LSHBloom: Memory-efficient, Extreme-scale Document Deduplication},
author = {Arham Khan and Robert Underwood and Carlo Siebenschuh and Yadu Babuji and Aswathy Ajith and Kyle Hippe and Ozan Gokdemir and Alexander Brace and Kyle Chard and Ian Foster},
journal= {arXiv preprint arXiv:2411.04257},
year = {2026}
}