多标签流分类中效率与效能的平衡及缺失标签鲁棒性提供
机器学习
2023-10-03 v1
摘要
现有针对数据流环境中多标签分类的工作聚焦于提出精确模型;然而,这些模型常效率低下且无法平衡效能与效率。本工作中,我们提出一种基于神经网络的方法解决此问题,适用于高维多标签分类。我们的模型使用选择性概念漂移适应机制,使其适用于非平稳环境。此外,我们通过一种简单而有效的填补策略使模型适应缺失标签环境,并证明其优于绝大多数最先进的监督模型。为实现目标,我们引入一种基于加权二元相关性、名为 ML-BELS 的方法,使用广度集成学习系统 (BELS) 作为基分类器。我们的模型采用独立的加权集成而非堆叠分类器链,权重由 BELS 分类器的预测生成。我们表明,在标签基数低的数据集上使用加权策略会对模型精度产生负面影响;鉴于此,我们使用标签基数作为应用权重的触发条件。我们使用 11 个最先进基线、5 个合成及 13 个真实世界数据集(均具不同特征)对模型进行了广泛评估。结果表明,所提方法 ML-BELS 成功平衡了效能与效率,并对缺失标签和概念漂移具有鲁棒性。
引用
@article{arxiv.2310.00665,
title = {Balancing Efficiency vs. Effectiveness and Providing Missing Label Robustness in Multi-Label Stream Classification},
author = {Sepehr Bakhshi and Fazli Can},
journal= {arXiv preprint arXiv:2310.00665},
year = {2023}
}