中文

面向新兴新颖子类的持续稀有类识别

机器学习 2019-07-01 v1 机器学习

摘要

给定一个包含稀有(或少数)感兴趣实例类以及大量不感兴趣实例类的标注数据集,我们如何学会在连续数据流上识别未来的感兴趣实例?我们提出 RaRecognize,它(i)估计稀有类与多数类之间的一般决策边界,(ii)学习识别训练数据中存在的各个稀有子类,以及(iii)将来自先前未见过的稀有子类的实例标记为新兴实例。其中(i)的学习器是通用的,因为其构造上不同于(ii)中的专用学习器,从而在不对训练数据中所见内容过度拟合的情况下区分少数类与多数类。得益于这种通用性,RaRecognize 忽略所有被其标记为多数类的未来实例,仅识别反复出现以及新兴的稀有子类。这在测试时节省了开销,并确保模型规模随时间适度增长,因为它仅维护专用的少数类学习器。通过大量实验,我们表明 RaRecognize 在包含企业风险与灾害文档作为稀有类的三个真实数据集上优于最先进的基线方法。

关键词

引用

@article{arxiv.1906.12218,
  title  = {Continual Rare-Class Recognition with Emerging Novel Subclasses},
  author = {Hung Nguyen and Xuejian Wang and Leman Akoglu},
  journal= {arXiv preprint arXiv:1906.12218},
  year   = {2019}
}

备注

accepted to PKDD ECML 2019