中文

SemDeDup:通过语义去重实现网页规模的数据高效学习

机器学习 2023-03-23 v3 人工智能 计算机视觉与模式识别

摘要

机器学习的进展在很大程度上由数据量的大幅增加所推动。然而,诸如 LAION 等大型网页规模数据集除了搜索精确重复项外基本未经筛选,可能保留大量冗余。在此,我们引入 SemDeDup,一种利用预训练模型嵌入来识别并移除语义重复项的方法:即在语义上相似但非完全等同的数据对。移除语义重复项可保持性能并加速学习。通过分析 LAION 的一个子集,我们表明 SemDeDup 可移除 50% 的数据且性能损失极小, effectively 将训练时间减半。此外,分布外性能有所提升。同时,通过分析在部分筛选的数据集 C4 上训练的语言模型,我们表明 SemDeDup 优于先前方法并提供了效率增益。SemDeDup 提供了一个示例,说明如何利用高质量嵌入的简单方法来使模型以更少数据更快学习。

关键词

引用

@article{arxiv.2303.09540,
  title  = {SemDeDup: Data-efficient learning at web-scale through semantic deduplication},
  author = {Amro Abbas and Kushal Tirumala and Dániel Simig and Surya Ganguli and Ari S. Morcos},
  journal= {arXiv preprint arXiv:2303.09540},
  year   = {2023}
}