面向社交媒体数据选择的生成式去重
计算与语言
2024-10-04 v3
摘要
社交媒体数据因其噪声特性而表现出严重的冗余,导致处理过程中训练时间增加和模型偏差。为解决这一问题,我们提出了一种新颖的生成式去重框架,通过移除语义重复数据来进行社交媒体数据选择。相关工作涉及任务特定训练中的数据选择,而我们的模型作为一种高效的预处理方法,可普遍增强社交媒体自然语言处理(NLP)流程。具体而言,我们通过自监督学习训练一个生成模型,预测一个关键词以捕获噪声社交媒体文本的语义用于去重。同时,加入时间维度的高斯噪声以提高训练复杂度并避免学习平凡特征。大量实验表明,与基线方法相比,我们的模型能更好地减少训练样本并提升性能。结果显示了我们的模型在有效性和效率方面广泛推进社交媒体语言理解的潜力。
引用
@article{arxiv.2401.05883,
title = {Generative Deduplication For Socia Media Data Selection},
author = {Xianming Li and Jing Li},
journal= {arXiv preprint arXiv:2401.05883},
year = {2024}
}
备注
Accepted by Findings of EMNLP 2024