中文

S2OSC:一种用于开集分类的整体半监督方法

机器学习 2020-08-12 v1 机器学习

摘要

开集分类(OSC)解决的问题是:在训练时仅提供一组类内样本的情况下,推断时判断数据是否属于类内或类外。传统 OSC 方法通常用类内数据训练判别或生成模型,然后利用预训练模型直接对测试数据进行分类。然而,这些方法总是受困于嵌入混淆问题,即部分类外实例与语义相似的类内实例混杂,难以分类。为解决该问题,我们统一半监督学习,提出一种新颖的 OSC 算法 S2OSC,以转导方式将类外实例过滤与模型重训练相结合。具体而言,给定一批新到来的测试数据,S2OSC 首先利用预训练模型过滤出明显的类外实例,并为其标注超类。然后,S2OSC 通过半监督范式结合类内与类外标注数据及剩余未标注测试数据训练整体分类模型,并集成预训练模型进行知识蒸馏以进一步分离混杂实例。尽管简单,实验结果表明 S2OSC 在多种 OSC 任务上达到最先进性能,包括在仅 300 个伪标签的 CIFAR-10 上取得 85.4% 的 F1。我们还展示了 S2OSC 如何借助流式数据有效扩展至增量 OSC 设定。

关键词

引用

@article{arxiv.2008.04662,
  title  = {S2OSC: A Holistic Semi-Supervised Approach for Open Set Classification},
  author = {Yang Yang and Zhen-Qiang Sun and Hui Xiong and Jian Yang},
  journal= {arXiv preprint arXiv:2008.04662},
  year   = {2020}
}

备注

10 pages, 3 figures