SEDD:基于GPU的可扩展高效数据集去重
计算与语言
2026-05-19 v4
摘要
数据集去重被广泛认为是提高数据质量和提升大语言模型性能的关键预处理步骤。该过程常用的一种方法是MinHash局部敏感哈希(LSH)算法。最近,诸如NVIDIA NeMo Curator等GPU加速框架已被引入以处理大规模语料库;然而,由于物理数据混洗带来的高通信开销以及GPU资源利用不足,它们仍然不是最优的。在本文中,我们提出了SEDD,一个针对分布式集群环境优化的高性能GPU加速去重框架。SEDD引入了一个计算高效、部分可重用的哈希函数,以及高度优化的GPU内核和硬件感知的自动参数选择机制。通过用基于流的方法取代传统的数据混洗,SEDD显著缓解了通信瓶颈。我们的框架在处理包含四个GPU的节点上的3000万文档时,性能比SlimPajama中基于CPU的去重工具高出158倍,比NVIDIA NeMo Curator中基于GPU的工具高出7.8倍。值得注意的是,SEDD极大地加速了以前耗时的MinHash签名生成阶段,与CPU基线相比实现了高达375倍的加速。尽管效率有所提升,SEDD仍保持了高去重保真度,重复文档集与标准MinHash算法识别的文档集相比,Jaccard相似度超过0.95。在大规模实验中,在8节点32 GPU V100集群上,1.2万亿token的去重在仅3小时内完成。相关代码已在GitHub上公开(https://github.com/mcrl/SEDD)。
引用
@article{arxiv.2501.01046,
title = {SEDD: Scalable and Efficient Dataset Deduplication with GPUs},
author = {Youngjun Son and Chaewon Kim and Jaejin Lee},
journal= {arXiv preprint arXiv:2501.01046},
year = {2026}
}
备注
13 pages, 7 figures