中文

SUDS:一种无监督漂移采样策略

机器学习 2024-11-06 v1 人工智能

摘要

监督式机器学习经常遇到概念漂移,即数据分布随时间变化,导致模型性能下降。现有的漂移检测方法侧重于识别这些变化,但往往忽视了在变化发生后获取标记数据以重新训练模型的挑战。我们提出了漂移采样策略(SUDS),这是一种新颖的方法,它利用现有的漂移检测算法选择同质样本进行重新训练,从而增强模型对演化数据的适应性。SUDS可与当前的漂移检测技术无缝集成。我们还引入了协调标注数据准确度度量(HADAM),该度量在考虑获取标记数据难度的前提下,评估分类器性能与达到所述性能所需标注数据量之间的关系。我们的贡献有两方面:SUDS将漂移检测与策略性采样相结合以改进重新训练过程,而HADAM提供了一种平衡分类器性能与标注数据量的度量,确保资源的高效利用。实证结果证明了SUDS在动态环境中优化标注数据使用的有效性,显著提升了机器学习应用在现实场景中的性能。我们的代码是开源的,可在https://github.com/cfellicious/SUDS/获取。

关键词

引用

@article{arxiv.2411.02995,
  title  = {SUDS: A Strategy for Unsupervised Drift Sampling},
  author = {Christofer Fellicious and Lorenz Wendlinger and Mario Gancarski and Jelena Mitrovic and Michael Granitzer},
  journal= {arXiv preprint arXiv:2411.02995},
  year   = {2024}
}

备注

9 pages, 5 tables, 3 figures