中文

利用异构网络数据与辅助类别的细粒度分类

计算机视觉与模式识别 2018-11-20 v1

摘要

细粒度分类仍然是一个非常具有挑战性的问题,其原因在于标注大量细粒度类别的成本高昂,导致缺乏标注良好的训练数据。在极端情况下,给定一组没有任何标注良好训练数据的测试类别,现有工作大多可归为以下两个研究方向:1)为测试类别爬取带噪声标签的网络数据作为训练数据,这被称为网络监督学习(webly supervised learning);2)将带有标注良好训练数据的辅助类别中的知识迁移到测试类别,这对应于零样本学习(zero-shot learning)设定。然而,上述两个研究方向仍存在亟待解决的关键问题。对于第一个方向,网络数据带有噪声标签,且与测试数据的数据分布差异显著。对于第二个方向,与传统监督学习相比,零样本学习难以取得令人满意的结果。上述两个方向的问题促使我们开发一种新方法,能够联合利用来自测试类别的噪声网络训练数据与来自辅助类别的标注良好训练数据。具体而言,一方面,我们为测试类别爬取网络数据作为噪声训练数据;另一方面,借助所有类别的免费语义信息(如词向量)将辅助类别中标注良好的训练数据的知识迁移到测试类别。此外,鉴于网络数据通常关联额外的文本信息(如标题与标签),我们通过将网络数据的周边文本信息作为特权信息来扩展我们的方法。大量实验表明了我们所提方法的有效性。

关键词

引用

@article{arxiv.1811.07567,
  title  = {Fine-grained Classification using Heterogeneous Web Data and Auxiliary Categories},
  author = {Li Niu and Ashok Veeraraghavan and Ashu Sabharwal},
  journal= {arXiv preprint arXiv:1811.07567},
  year   = {2018}
}