一种基于主动学习的预训练数据去重模型
机器学习
2025-01-13 v4 人工智能
摘要
在大数据时代,数据质量问题日益突出。主要挑战之一是重复数据问题,其可能源于重复录入或多数据源合并。这些“脏数据”问题会严重限制大数据的有效应用。为解决数据去重问题,我们提出一种基于主动学习的预训练去重模型,这是首项利用主动学习在语义层面解决去重问题的工作。该模型构建于预训练Transformer之上,并微调以将去重问题作为序列到分类任务求解;其首次将Transformer与主动学习集成至端到端架构中以筛选对去重模型训练最有价值的数据,并首次采用R-Drop方法对每轮标注数据进行数据增强,从而降低人工标注成本并提升模型性能。实验结果表明,我们所提模型优于先前最先进(state-of-the-art, SOTA)的去重数据识别方法,在基准数据集上召回率分数最高提升28%。
引用
@article{arxiv.2308.00721,
title = {A Pre-trained Data Deduplication Model based on Active Learning},
author = {Haochen Shi and Xinyao Liu and Fengmao Lv and Hongtao Xue and Jie Hu and Shengdong Du and Tianrui Li},
journal= {arXiv preprint arXiv:2308.00721},
year = {2025}
}