中文

极端多标签数据流中输出空间的在线层次分区

机器学习 2025-12-08 v1 人工智能

摘要

从多标签数据流中挖掘数据面临显著挑战,包括分布演变、高维标签空间、稀疏标签出现以及复杂标签依赖。此外,概念漂移不仅影响输入分布,还影响标签相关性和不平衡比率,使模型适应更加复杂。为此,结构学习器分为局部方法和全局方法。局部方法将任务分解为更简单的组件,而全局方法则针对完整输出空间调整算法,可能通过利用标签相关性获得更好的预测。本工作引入 iHOMER (增量式多标签分类器层次结构),一个在线多标签学习框架,能够在不依赖预定义层次结构的情况下,逐步将标签空间划分为互不重叠且相关性较大的簇。iHOMER 利用基于 Jaccard 相似度的在线分割-聚类方法,以及由多变量 Bernoulli 流程驱动的全局基于树的学习器,以指导实例划分。为解决非平稳性,它整合了全局和局部层面的漂移检测机制,使标签分区和子树能够动态重构。跨 23 个真实数据集的实验表明,iHOMER 在 5 个最先进的全局基线(如 MLHAT、MLHT、iSOUPT 等)方面优于 23%,在 12 个局部基线(如 kNN、EFDT、ARF、ADWIN 等的二元相关转换)方面优于 32%,确立了其在在线多标签分类中的鲁棒性。

关键词

引用

@article{arxiv.2507.20894,
  title  = {Online hierarchical partitioning of the output space in extreme multi-label data stream},
  author = {Lara Neves and Afonso Lourenço and Alberto Cano and Goreti Marreiros},
  journal= {arXiv preprint arXiv:2507.20894},
  year   = {2025}
}

备注

Accepted at 28th European Conference on Artificial Intelligence (ECAI 2025)