用于维基百科人工数据集去重的LSH方法
计算与语言
2021-12-23 v1 信息检索
机器学习
摘要
本文阐述了用于文本数据集中识别与移除近似冗余数据的局部敏感哈希(LSH)模型。为评估不同模型,我们使用英文维基百科文章构建了一个用于数据去重的人工数据集。多数模型的曲线下面积(AUC)超过0.9,最佳模型达到0.96。去重通过防止模型因重复数据而学习到偏离真实分布的数据分布,从而实现更有效的模型训练。
引用
@article{arxiv.2112.11478,
title = {LSH methods for data deduplication in a Wikipedia artificial dataset},
author = {Juan Ciro and Daniel Galvez and Tim Schlippe and David Kanter},
journal= {arXiv preprint arXiv:2112.11478},
year = {2021}
}