文本流中生成漂移的方法
机器学习
2024-03-20 v1 计算与语言
信息检索
摘要
系统和个体持续产生数据。在互联网上,人们分享他们的知识、情感和观点,提供服务与产品的评论等等。从这些文本数据中自动学习可以为组织和机构提供洞察,从而例如防止财务影响。为了随时间从文本数据中学习,机器学习系统必须考虑概念漂移。概念漂移是现实世界数据集中常见的现象,对应于数据分布随时间的变化。例如,当情感发生变化或某个词的含义随时间调整时,就会发生概念漂移。尽管概念漂移在现实世界应用中频繁出现,但文献中带有标注漂移的基准数据集却很少。为了弥补这一差距,本文提供了四种文本漂移生成方法,以简化带有标注漂移的数据集的制作。这些方法被应用于 Yelp 和 Airbnb 数据集,并使用遵循流挖掘范式的增量分类器进行测试,以评估它们从漂移中恢复的能力。结果表明,所有方法的性能在漂移发生后立即下降,而增量 SVM 在运行速度和恢复先前准确率及宏观 F1 分数性能水平方面是最快的。
引用
@article{arxiv.2403.12328,
title = {Methods for Generating Drift in Text Streams},
author = {Cristiano Mesquita Garcia and Alessandro Lameiras Koerich and Alceu de Souza Britto and Jean Paul Barddal},
journal= {arXiv preprint arXiv:2403.12328},
year = {2024}
}