SemDeDup:通过语义去重实现网页规模的数据高效学习
机器学习
2023-03-23 v3 人工智能
计算机视觉与模式识别
摘要
机器学习的进展在很大程度上由数据量的大幅增加所推动。然而,诸如 LAION 等大型网页规模数据集除了搜索精确重复项外基本未经筛选,可能保留大量冗余。在此,我们引入 SemDeDup,一种利用预训练模型嵌入来识别并移除语义重复项的方法:即在语义上相似但非完全等同的数据对。移除语义重复项可保持性能并加速学习。通过分析 LAION 的一个子集,我们表明 SemDeDup 可移除 50% 的数据且性能损失极小, effectively 将训练时间减半。此外,分布外性能有所提升。同时,通过分析在部分筛选的数据集 C4 上训练的语言模型,我们表明 SemDeDup 优于先前方法并提供了效率增益。SemDeDup 提供了一个示例,说明如何利用高质量嵌入的简单方法来使模型以更少数据更快学习。
引用
@article{arxiv.2303.09540,
title = {SemDeDup: Data-efficient learning at web-scale through semantic deduplication},
author = {Amro Abbas and Kushal Tirumala and Dániel Simig and Surya Ganguli and Ari S. Morcos},
journal= {arXiv preprint arXiv:2303.09540},
year = {2023}
}